AI 新闻摘要 2026-08-25

发布于 2026年08月25日

行业与公司动态

吴恩达重启 DeepLearning.ai,聚焦 AI 工程师培养

吴恩达(Google Brain 联合创始人)正式重启 DeepLearning.ai,转向「AI 工程师」能力体系。基于超 1 万份岗位分析、数十场专家访谈和问卷调研,提炼出四大核心技能:构建部署 AI 应用、软件工程基础、高效使用编码 Agent、塑造产品构建方向。
> 相关链接:官方公告


Agent 与工具链

NVIDIA 提出「技能提升值」评估法:Harness 比模型更能决定 Agent 实用性

NVIDIA 新研究发现,传统 Agent 技能评分(如 scan score)和实际质量相关性极弱(Spearman ρ=0.14),转而提出「Skill Lift」:同一任务下,开/关某项技能时完成工作的差值才是关键指标。
> 相关链接:论文摘要(@omarsar0

Anthropic 推出企业级 MCP 统一认证:告别每个工具单独 OAuth

Anthropic 为 MCP(Model Context Protocol)连接器上线企业托管身份认证,支持 Asana、Notion、Slack 等 8+ 工具通过企业统一身份源(如 Okta)集中授权,不再需要用户逐个点授权。
> 相关链接:官方公告

Headlong 和 exo 开源:首个支持「持续思考」与「安全自修改」的 Agent Harness

Headlong 是开源微 harness,让 Agent 7×24 自主运行、自动调试(实测 48 分钟完成无人修复);exo 则支持 append-only 日志、沙箱快照回滚,允许 Agent 修改 prompt/工具/记忆,但无法破坏持久状态。
> 相关链接:Headlong 介绍(@andykonwinskiexo 架构说明(@omarsar0


模型与能力

Qwen3.8-27B 在 WebDev 编码榜杀入 Top 10,是同尺寸唯一上榜模型

Qwen3.8-27B 在 Code Arena WebDev 榜单拿下第 9 名(1595 分),力压多数 30B+ 模型,仅比旗舰版 Qwen3.8-Max 低 6 名;其开源衍生版 Carnice-V3-27B 已适配消费级显卡(RTX 3090+)。
> 相关链接:榜单更新(@arenaCarnice-V3 开源(@kaiostephens

OpenAI GPT-5.6 Sol API 降价:输入 $4/M,输出 $20/M token

GPT-5.6 Sol 版本 API 价格大幅下调,输入成本降为 $4/百万 token,输出 $20/百万 token;在 Terminal-Bench 2.1 中,Kiro 环境下每任务成本降低约 82%。
> 相关链接:定价公告(@kimmonismusKiro 性能说明

Claude 近半年无 Opus 线升级,但新变体中等推理能力明显增强

尽管 Anthropic 已超 6 个月未发布明确的 Opus 系列升级,外部测试者报告新版 Claude 在中等难度推理任务上表现更强,暗示底层模型可能已悄然迭代。
> 相关链接:技术观察(@tenobrus实测反馈(@kimmonismus


基础设施与硬件

Groq 推出 Vera Rubin 新芯片:Gemma 4 31B 下达 3400 tok/s 输出吞吐

Groq 在 Vera Rubin 芯片上新增专用 token 生成加速器,实测 Gemma 4 31B 在 100K 上下文下输出达 3400 tokens/秒;将首批投入生产环境。
> 相关链接:性能摘要(@kimmonismus官方发布

vLLM 发布 AgentX 1.0:专为多轮 Agent 场景优化 KV 卸载与前缀复用

vLLM 新版 AgentX 针对真实多轮编程轨迹优化,强调 KV 缓存卸载、前缀复用、prefill/decode 解耦——这些比传统单次推理 TPS 更影响 Agent 实际吞吐。
> 相关链接:技术总结(@vllm_project

Liquid AI 推出 Pipette:首个开源端侧推理全栈评测套件

Pipette 开源评测框架覆盖模型+量化+运行时+设备组合,含 10,000+ 经验证结果,支持 iPhone 17 Pro / Galaxy S26 Ultra 等真机测试,直击内存、延迟、质量三重瓶颈。
> 相关链接:项目主页(@liquidai


研究与方法

Speculative Programmatic Tool Calling(sPTC):让 Agent 工具调用提前执行

sPTC 方法在代码生成时预测安全工具调用,并提前在副本环境中启动执行,实现工具运行与 token 生成重叠,初步提速 1.0–1.2×,思路类似 CPU 的推测执行。
> 相关链接:方法介绍(@a1zhang

RL for LLMs 全面指南发布:覆盖 PPO/GRPO、rubric-based、agentic RL 等主流路线

CWolfe Research 发布完整强化学习训练指南,涵盖 token 级 vs 完成级奖励设计、actor-critic 结构、世界建模集成等,同步推动「harness-native RL」成为新热点。
> 相关链接:指南全文(@cwolferesearch


产品与应用落地

Claude 网页/桌面端长回答流式体验升级:卡顿减少 9 倍,最差冻结缩短 4.5 倍

Anthropic 优化了 Claude 长文本输出流式渲染,在低端笔记本上卡顿次数减少 9 倍,最严重冻结时间缩短 4.5 倍,整体流畅度提升约 4 倍。
> 相关链接:官方公告


政策、治理与安全

多篇讨论警告:缓存 token 计入「用量」不反映真实成本,量化过拟合易被误读为能力提升

社区指出,把缓存命中 token 算进总用量会严重误导成本评估;另有多人提醒:量化后模型在某基准反超原模型,很可能是过拟合量化过程,而非真实能力进步。
> 相关链接:DeepSWE token 说明(@bnjmn_marie量化过拟合警示(@jmbollenbacher




评论