AI 新闻摘要 2026-08-21

发布于 2026年08月21日

行业与公司动态

Poolside 核心团队被 NVIDIA 全员吸纳,Model Factory 技术并入 Rubin 项目

Poolside 创始团队将公司技术方向大幅转向新领域,NVIDIA 直接接手其 Model Factory 技术,并雇佣 109 名核心员工(占技术团队绝大多数);这不是收购或‘execu-hire’,而是创始人主动 pivot,员工获优厚安置。
> 相关链接:Latent Space 原文


基础设施与硬件

OpenAI 首批 NVIDIA Vera Rubin 集群已上线,专用于下一代前沿模型预训练

OpenAI 正式启用 NVIDIA 最新 Vera Rubin 芯片集群,这是其下一代大模型预训练的底层硬件基础,标志 OpenAI-NVIDIA 深度合作进入新阶段。
> 相关链接:推文确认

Cerebras CS-4 推出:单晶圆性能翻倍,GPT-OSS-120B 推理达 4400+ tok/s

Cerebras 新一代 CS-4 系统通过重构供电与散热,在相同 5nm 晶圆上实现性能翻倍;实测 GPT-OSS-120B 推理速度超 GPU 方案 30 倍,达 4400+ tokens/秒。
> 相关链接:技术总结


模型与能力

Gemini 3.7 Flash:ARC-AGI-2 达 84.6%,仅 $0.25/任务,性价比突出

Gemini 3.7 Flash 在 ARC-AGI-2 基准中得分 84.6%(ARC-AGI-1 更达 95.5%),单价低至 $0.12–$0.25/任务,成目前成本效益比最高的强推理模型之一。
> 相关链接:ARC-AGI 测评

Qwen3.8-27B 明确转向工具调用与编码,知识召回能力弱于 Qwen3.6

Qwen3.8-27B 在离线知识检索(如历史、地理、冷门事实)上明显退化,但工具调用、代码生成和 agentic 工作流更强——这是有意为之的参数分配取舍。
> 相关链接:Reddit 讨论

GLM-5.3 Max 成开源代码模型新标杆:WebDev 得分 1597,$3.65/M

Zhipu GLM-5.3 Max 在 Code Arena WebDev 榜单跃居开源模型第 2(总榜第 8),1597 分,单位成本 $3.65/百万 token,刷新开源模型性价比纪录。
> 相关链接:Code Arena 数据


Agent 与工具链

Anthropic 宣布 Claude Platform 多项功能正式商用:Computer Use、Skills API、Files API 全量开放

Anthropic 将浏览器控制、文件操作、可版本化技能调用等关键 Agent 能力全部 GA;Skills API 支持复用流程,Files API 提升速率至 500 RPM、支持 1TB/org 和过期管理。
> 相关链接:官方公告

ChatGPT Mac 版上线 Apple Messages 插件:可搜索、起草、发送消息

ChatGPT Work/Codex Mac 客户端新增 Messages 插件,支持读取历史消息、快速回复、草稿撰写和一键发送,首次实现 AI 助手深度接入系统级通信应用。
> 相关链接:功能发布

Chroma 发布 Foundation:首个基于过往会话自动构建的 Agent 自进化记忆系统

Chroma 推出 Foundation 记忆框架,让 Agent 能从历史交互中自动提炼技能、偏好与上下文,不再依赖人工设定或单次 prompt,迈向持久化智能体。
> 相关链接:研究预览


产品与应用落地

AT&T 公开企业 AI 实践:40% 流量已切至开源模型,目标提升至 60–70%

AT&T 内部数据显示,员工 AI 使用中 40% 已路由到开源模型,目标达 60–70%;编码成本降 56%,质量仅微跌 2%,验证开源模型在企业中段场景的高性价比。
> 相关链接:Hesamation 总结

OpenAI 推出 ChatGPT Sites 协同编辑:支持 Git/CI 管理与 PR 上下文共享

ChatGPT Sites 新增团队协作功能,多人可实时共编一个项目,Codex 自动处理 Git 提交与 CI 流程;还支持生成只读链接和嵌入 PR 上下文,降低协作门槛。
> 相关链接:API 更新说明PR 上下文分享


研究与方法

Harness Continual Learning:Agent 的提示、记忆、技能可独立演化,防‘组件遗忘’

新研究提出‘守护式 harness 演化’框架,让 Agent 的 prompt、记忆、技能等组件自主更新,但需先提案再审核才提交,避免改一个功能崩掉整个工作流。
> 相关链接:论文亮点

Unsloth 发布 Qwen3.8-27B Dynamic v3 GGUF:同尺寸下 top-1 准确率提升 >10%

Unsloth 推出 Qwen3.8-27B 新版 GGUF 量化(Dynamic v3),不依赖校准数据集,仅后训练量化,宣称在同等大小下 top-1 准确率提升超 10%,最低支持 1-bit 运行于 ~8GB RAM。
> 相关链接:技术发布


政策、治理与安全

Anthropic 开源 Petri:首个面向对齐风险的可审计评测工具

Anthropic 发布 Petri 工具包,用于系统性评估模型迎合、欺骗等对齐风险,支持外部第三方审计,填补当前对齐评测可验证性空白。
> 相关链接:Anthropic 官方推文




评论