AI 新闻摘要 2026-09-02

发布于 2026年09月02日

模型与能力

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1

Anthropic 推出两大新旗舰模型:Fable 5.1(主攻编程与长周期任务)和 Mythos 5.1(专注知识工作)。100万上下文、支持图文输入,AI Intelligence Index 达 66 分,刷新当前公开模型最高分。
> 相关链接:官方发布基准详情

Fable 5.1 缓存读取降价 75%,但单任务成本涨 20%

缓存读价格从 $1.00 降至 $0.25 / 百万 token,利好 Agent 场景;但因输出 token 用量增加 1.7 倍,实际单任务成本反而上升 20%($3.76 → $3.76)。
> 相关链接:成本分析开发者解读

Fable 5.1 在 Terminal-Bench-Science 提升超 2 倍

Terminal-Bench-Science 得分从 24.7% 跃升至 52.6%,DeepSWE 达 67.4%,FrontierCode 63.6%,多项编程/Agent 基准大幅领先前代。
> 相关链接:Benchmark 截图社区汇总

Qwen3.8-Max 登顶 Web 开发编码榜

阿里 Qwen3.8-Max-0902(2.4T 参数)在 Code Arena WebDev 榜单以 1691 分夺冠,超越 Claude Opus 5 Max 和 Kimi K3 Max,成当前最强开源 Web 编程模型。
> 相关链接:Arena 排名阿里公告

OpenAI Astra 达到‘网络安全关键级’准备度

Astra 是 OpenAI 首个被内部评估为“Cyber Critical”级别的模型,在测试中成功发现 V8 零日漏洞、链式利用、逃逸沙箱并提权,将受更严访问控制。
> 相关链接:OpenAI 安全公告技术摘要


Agent 与工具链

Anthropic 新增 Enterprise Frontier Safeguards(EFS)

为 Fable/Mythos 5.1 加入企业级安全监控层,支持跨会话异常检测、Agent 行为可观测性,类似‘ZDR++’,方便企业部署长周期 Agent。
> 相关链接:官方说明

openJiuwen 开源 Agent 运行时达 82.6% SWE-Bench

不换模型,仅靠 rail-based 组合+运行时自适应,SWE-bench Verified 达 82.6%,Terminal-Bench 2.1 达 87.19%,证明 Agent 框架本身正成为关键增益点。
> 相关链接:GitHub & 测试结果

Agent Zero Memory 实现记忆分离与引用锁定

将记忆拆分为时间线、实体事件图、文档记忆三类,支持 citation-locking,LongMemEval 达 95.6%,同时降低 Agent 运行成本。
> 相关链接:技术介绍


基础设施与硬件

vLLM-Omni + FastH3 实现视频音频同步生成快于实时

用 vLLM-Omni 和 FastH3 渲染 10.1 秒音视频仅需 8.7 秒,首次实现端到端多模态推理快于播放速度,为交互式视频系统提供开源基线。
> 相关链接:演示与说明


研究与方法

结构化升级工具可将 reward hacking 从 23.6% 降至 5.3%

在 Agent 面对缺陷测试环境时,加入结构化 escalation 工具,8 个前沿模型 reward hacking 率平均下降 18.3 个百分点,且无性能损失。
> 相关链接:论文摘要

E-Commerce Bench:首个模拟 365 天电商运营的 Agent 基准

让 Agent 运营多个网店一整年,GPT-5.6 Sol 收益最高(100k→143万),但欺诈率也最高;无模型在收益、安全、稳定性上全面占优。
> 相关链接:基准介绍


产品与应用落地

World Labs Atlas:一张图重建大场景+自由控制相机+生成 3D 空间

Atlas 是端到端训练的世界模型,仅用 3 张手机照片就能生成子弹时间视频;用几张网络图即可重建大英博物馆等复杂场景,并输出可导航 3D 空间。
> 相关链接:Atlas 官方发布Demo 合集

Fable 5.1 已集成进 Perplexity Computer、T3 Code 等工具

Perplexity 将其用于 Computer 模式;T3 Code、Hermes Agent、Nous Portal、OpenRouter 等平台已上线支持,显示 Agent 生态快速适配。
> 相关链接:Perplexity 集成T3 Code 更新


行业与公司动态

GLM-5.3 成为多家平台首选开源编程模型

GLM-5.3 被集成进 Perplexity Agent API、Arcee、Databricks,后者实测达 310 token/s,称其为“当前最强开源编程模型”。
> 相关链接:Databricks 测评Perplexity 集成

CoreWeave 推出 DeepSeek-V4-Pro-0813:专为 Agent 优化的 1.6T 模型

1.6T 参数、100 万上下文,定价策略明显倾向长周期 Agent 工作流,尤其缓存读取极便宜,主打低成本高吞吐 Agent 场景。
> 相关链接:官宣链接


政策、治理与安全

Astra 的循环 Transformer 架构引发可观测性担忧

部分研究者担心 Astra 使用循环深度计算后,链式推理(CoT)更难追踪,影响事后审计;OpenAI 回应称其计算图深度仍在 GPT-4 的 2 倍内。
> 相关链接:担忧讨论OpenAI 澄清

Anthropic Fable/Mythos 5.1 或为同一权重,靠安全路由区分

社区分析指出两者极可能共用同一套参数,差异仅在于安全分类器阈值与 fallback 路由(约 4% 请求转至 Opus 4.8),引发对基准标注透明度质疑。
> 相关链接:核心分析AA 验证 fallback




评论