微软正式开源 Agent Lightning v1.0,一个仅约 3,500 行代码的轻量级强化学习框架,专门用于训练和优化 AI 智能体。支持与 OpenAI Agents SDK、AutoGen、LangChain 等主流框架集成,通过捕获真实 Agent 行为并将其转换为 RL 转换信号进行训练,兼容现有架构。
2026 年 8 月 31 日,AWS 宣布 Agent Registry 正式商用。该服务提供统一的 Agent 注册、发现和治理目录,支持跨 AWS Organizations 自动发现 AgentCore Runtime 和 Gateway,并新增客户管理密钥(CMK)加密。基于消费计费,附赠月度免费额度。
vLLM v0.28.0 于 8 月 26 日发布,包含 584 次提交、来自 270 位贡献者(76 位新贡献者)。核心亮点:层级化 KV Cache 卸载至磁盘、Decode Context Parallel 终结上下文长度开销、Kimi-K3 融合 kernel、DeepSeek V4 端到端稀疏 MLA、DFlash2 投机解码、Model Runner V2 成熟化。同时弃用 bitsandbytes 量化支持。
v0.28.0 包含 584 commits / 270 贡献者。主要变化:层级化 KV Cache 卸载扩展到磁盘,默认 max_num_batched_tokens 从 8192 提升至 65536,弃用 bitsandbytes 量化库,新增 Decode Context Parallel(终结上下文长度税),融合 kernel 支持 Kimi-K3,端到端稀疏 MLA 支持 DeepSeek V4,DFlash2 投机解码(置信度调度验证),Model Runner V2 成熟化。
GitHub Release2026 年 8 月 27 日发布。修复了应用跟随系统外观的深色模式支持;修复 macOS 应用启动时重复实例问题;Claude Desktop 代理不再在模型目录更新时中断正在进行的请求。此前 Ollama v0.33.0 新增了 Claude Desktop 网关集成,支持在 Claude Desktop 中运行 Qwen、DeepSeek 等本地模型。
GitHub Release8 月 28 日发布 b10670。主要更新:SYCL 后端使用 TILE 指令集优化 Xe2 (BMG) 上的量化 KV 解码,版本号提升至 0.3.0,ggml 同步至 v0.22.0(元后端张量拆分、Metal 并行编译 kernel),新增 LLAMA_SERVER_SLOTS_N_DIFF 调试功能。
GitHub Release8 月 22 日发布。包含 710 个 PR,来自 212 位贡献者。Qwen3-32B 冷启动从 84.8s 降至 35.6s(2.38x),Lmhead decode step 从 320us 降至 169us。新增 7 个模型家族支持:Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image。所有编译 kernel 缓存移至 SGLANG_CACHE_DIR。
GitHub Release完整支持异步 GRPO(Group Relative Policy Optimization)与 vLLM 集成,包含异步数据生产者 + 回放缓冲区、流式部分批次训练、原生 LoRA 权重同步到 vLLM、FP8 兼容。支持 FSDP1/FSDP2 和 DeepSpeed ZeRO-3 多 GPU 训练。在 Qwen2-0.5B 上实现 1.59s/step vs 基线 3.79s/step,加速 58%。
GitHub Release8 月 19 日发布 Unsloth Dynamic 3.0,新一代 GGUF 量化方案。在相同文件大小下,相比其他方案保持 10%+ 的 top-1% 精度。首批 v3.0 完整覆盖 Qwen3.8 系列。同时 save_pretrained_gguf 新增 imatrix_file 参数支持 IQ 低位量化导出。
GitHub ReleaseDeep Agents v0.7 重构基础 harness,输入 token 减少 65%。Managed Deep Agents 进入公测,支持一键部署到托管 LangSmith 运行时,内置持久化执行、沙箱、追踪。LLM Gateway 进入公测,提供代理与模型之间的中间层管控。Tuned Evaluators 上线,首个评估器为 Perceived Error。AWS BYOC 支持 LangSmith 在企业 VPC 内运行。
LangChain Blog6 月发布 Workflows 1.0,采用事件驱动、异步优先架构,Python + TypeScript 双支持。近期博客分享了如何使用 Temporal 实现可扩展的可靠文档编排。LlamaParse 发布新 SDK 和 Parse API v2。LlamaIndex 已完成 Agent 合并,FunctionCallingAgent 替代旧版 ReActAgent。
LlamaIndex Blog8 月 19 日发布 v0.22.0。运行时支持从可重放、可持久化的 SDK 状态中脱敏被 Agent 输出护栏拒绝的终态函数工具输出。非流式 Responses 若以 failed 状态终止,将保留工具输出以供回归测试。此前 v0.20.0 切换默认模型为 GPT-5.6 Luna,支持 MCP 2026-07-28 协议。
OpenAI Agents SDK8 月 20 日发布。新增声明式对话流(Declarative Conversational Flows),支持 opt-in 会话模式;改进工具处理(AMP slug 支持、超长消息分块);修复 MCP 服务器配置、Agent 作用域关闭、工具错误归因等关键 Bug;SSRF 检查按每跳重定向和 peer IP 进行;修复 OpenAI Responses API 本机工具调用兼容性。
GitHub Release8 月 31 日发布 .NET 版 v1.20.0。微软 Agent Framework 由 AutoGen 和 Semantic Kernel 合并而来,1.0 GA 于 4 月发布,支持 YAML Agent 定义、基于图的带 checkpoint 工作流、原生 MCP 和 A2A 协议。
GitHub Release| # | 模型名称 | 类型 | ❤️ | ⬇️ 下载量 |
|---|---|---|---|---|
| 1 | Qwen/Qwen3.8-27B | image-text-to-text | 12,624 | 2,945,415 |
| 2 | unsloth/Qwen3.8-27B-GGUF | GGUF 量化 | 2,884 | 7,334,695 |
| 3 | ornith-ai/Ornith-1.5-35B-A3B | text-generation | 409 | 70,158 |
| 4 | Lightricks/LTX-2.5 | image-to-video | 1,758 | 833,845 |
| 5 | MiniMaxAI/MiniMax-Music3 | text-to-audio | 1,237 | 18,705 |
| 6 | MiniMaxAI/MiniMax-H3 | image-text-to-video | 4,438 | 4,639,786 |
| 7 | z-lab/Qwen3.8-27B-DFlash2 | text-generation | 224 | 64,984 |
| 8 | pipecat-ai/phonellm-alpha-1 | text-generation | 168 | 4,721 |
| 9 | Qwen/Qwen3.8-Flash-Next-FP8 | image-text-to-text | 173 | 84,954 |
| 10 | superwhisper/s1-mini | text-generation | 232 | 3,474 |
| # | 数据集名称 | ❤️ | ⬇️ 下载量 |
|---|---|---|---|
| 1 | openbmb/Ultra-FineWeb-L1 | 151 | 11,243 |
| 2 | Anthropic/claude-protein-binder-design | 137 | 23,990 |
| 3 | HuggingFaceCode/stack-v3-train | 369 | 255,776 |
| 4 | r0b0tlab/qwen3.8-max-glm5.2-kimi-k3-distillation | 208 | 6,790 |
| 5 | nvidia/Cosmos3-DROID | 40 | 37,186 |
| 6 | ChartGalaxy/ChartGalaxy | 86 | 114,050 |
智谱 AI 于 8 月 28 日正式发布 GLM-5.3 开放权重(BF16 和 FP8 版本),采用 753B 参数 MoE 架构(40B 活跃参数),支持 1M token 上下文窗口。兼容 vLLM、SGLang、KTransformers 和 HF Transformers。使用自定义 GLM-5.3 许可证(非 MIT),但 Flash 变体为 MIT 许可。在 CyberGym 安全基准上保持领先。
Hugging FaceHugging Face 发布 2026 上半年开放模型报告(1-8 月):公共模型仓库从 243 万增至 296 万,数据集首次突破 100 万,Spaces 从 100 万增至 144 万。Qwen 系列以 151,448 个衍生模型排名第一,是 Meta 生态的 2.6 倍。小模型(<1B)仍占 83% 的下载量。下载量分布显示 85.6% 集中在头部 1% 的模型。
TUN Report微软正式开源 Agent Lightning v1.0(MIT 许可),一个全新的轻量级 Agent 强化学习训练框架。核心代码仅约 3,500 行,支持与 OpenAI Agents SDK、AutoGen、LangChain 等主流 Agent 框架集成。通过捕获真实 Agent 行为并转换为 RL 转换信号来优化模型性能,支持模型微调、prompt 优化、模型选择等多种优化策略。
GitHub8 月 31 日,AWS 宣布 Agent Registry 正式商用。通过 Amazon Bedrock AgentCore 提供,支持:跨 AWS Organizations 自动发现 AgentCore Runtime 和 Gateway;客户管理密钥(CMK)加密;MCP 服务器同步;消费计费 + 月度免费额度。组织可在一个中心目录中注册、发布和管理 Agent、工具和技能。
AWS Docs8 月 31 日 InfoQ 报道。Cloudflare Flux 使用隔离的 Firecracker 微 VM、MCP 网关、可重用的 Playbook 和多种调用接口来运行 Agent 工作流,具备范围化访问和集中审计能力。95% 端到端设置时间低于 5 秒。同时 Cloudflare 扩展了 AI 搜索能力,使 Agent 和开发者更易搜索自定义数据。
InfoQ8 月 4 日 AWS 开源 Kiro Crew(Apache 2.0),内部代号 MeshClaw,已在 Amazon 内部被 39,000+ 开发者使用,500+ 内部贡献者参与开发。Agent 可跨会话记忆、由 cron 定时调度、使用 OS 级沙箱隔离,支持 MCP 和 webhook 集成外部工具。Kiro 报告称比替代方案成本效益高 50%。
InfoQ微软在 Azure Dev Blog 发布技术文章,提出面向 Agentic AI 系统的验证框架,重点关注自主 Agent 信任模型的可靠性和安全性。该框架仍处于理论阶段,但代表了微软在 Agent 安全治理方面的早期探索。
ClawdBytes8 月 LangGraph 更新工作流能力:节点缓存(跳过重新运行时的冗余计算)、延迟节点(fan-in 屏障)、Pre/Post 模型钩子(上下文修剪、护栏、PII 脱敏)、Content-block 流式 API。Deep Agents v0.7 简化 harness 使输入 token 减少 65%。
LangChain Changelog8 月 20 日 OpenAI 发布《Codex as a platform: build on the open agent harness》,允许开发者基于开源的 Codex Harness 构建自己的 Agent 应用。Codex App、CLI 和 IDE 扩展使用同一套底层 Harness,管理会话状态、上下文、工具调用、沙箱和人工审批。
36氪层级化 KV Cache 卸载扩展到磁盘,小显存用户可在单卡上运行更长上下文。Decode Context Parallel 结束上下文长度税,多 GPU 场景下解碼阶段不再受单 GPU 显存限制。此外,默认 max_num_batched_tokens 从 8192 提升至 65536,Model Runner V2 进入成熟阶段。
AI Wain BlogQwen3-32B 冷启动从 84.8s 降至 35.6s。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型家族。核心依赖更新至 torch 2.13.0、triton 3.7.1、flashinfer 0.6.17。
AI TLDR8 月 17 日 CNCF 宣布 Kubeflow 正式毕业(Graduation),标志着其达到基金会的最高成熟度级别。Kubeflow 拥有 6,600+ 贡献者、1,000+ 组织、33,000+ GitHub Stars。支持数据预处理、模型训练、微调、推理和模型服务的全生命周期管理。
CNCF8 月 21 日 DeepSeek 上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp,Terminal Bench 2.1 得分 83.9,支持 NL2Repo 等任务。此前 8 月 13 日 DeepSeek V4 Pro GA 正式发布,支持 Responses API 和 Codex 集成,Agent 能力大幅提升。
DeepSeek API Docs8 月 31 日 Ollama 博客宣布采用行业标准的按 token 定价模式,Free 计划包含少量月度用量,Pro $20/月,Max $100/月,Team $500/月(含 $1,000 共享用量)。所有计划无服务费、无隐藏限制。同时支持 Claude Desktop 作为第三方网关提供商,可在桌面端使用开源模型。
Ollama BlogDDN 发布 2026 AI 基础设施报告,指出 98% 的组织存在 AI 基础设施技能缺口,65% 认为环境过于复杂,超过一半的企业已推迟或取消 AI 项目。技能缺口集中在 MLOps 管道自动化、GPU 集群管理、LLM 数据治理和实时推理优化。
Auton AI News8 月 22 日 AWS 宣布 DynamoDB 原生向量搜索正式商用。具备个位数毫秒延迟、99%+ recall,支持规模化扩展。这是首个主流云厂商在 NoSQL 数据库中直接集成向量搜索能力,对专用向量数据库市场构成冲击。
CSDN