AI 新闻摘要 2026-10-06

发布于 2026年10月06日

模型与能力

Reflection 发布 Beam:501B 总参、23B 激活的开源 MoE 编程模型

Reflection 正式发布 Beam,一个从零训练的文本-only MoE 模型(501B 总参数 / 23B 激活),专注编程、科学计算和智能体任务;Apache 2.0 开源,全权重本月上线。
> 相关链接:官方公告|训练细节(23.8T token + OCR PDF 数据)

Aleph Alpha 发布 Kolibri:德英双语 78B 开源模型

Aleph Alpha 推出 Kolibri(78B 总参 / 3.46B 激活),Apache 2.0 开源,自称在 AIME 2025 达 96.9%、SWE-Bench Verified 达 66.4%,但数据集未公开,智能体评测落后于 Qwen。
> 相关链接:模型摘要

Reka 发布 Rho-1:19B 多模态原生模型

Reka 推出 Rho-1(19B 参数),原生支持文本、图像、视频和机器人动作理解与生成,在 320 块 H100 上训练约 3 个月。
> 相关链接:官方发布

Upstage Solar Mini 4 免费开放两周

Upstage 推出 Solar Mini 4(35B 总参 / 3B 激活,512K 上下文),即日起在 Nous Portal 免费试用两周。
> 相关链接:Nous Portal

ElevenLabs v4 Turbo:语音合成性价比翻倍

ElevenLabs v4 Turbo 在 Artificial Analysis 语音评测中排名第一,价格仅为 v4 的一半。
> 相关链接:AA 评测


Agent 与工具链

Hugging Face 推出多协议 RL 捕获代理(Multi-harness RL)

Hugging Face 新工具可兼容 OpenAI/Anthropic/Gemini 等 API 格式,自动转发请求到 vLLM 并记录 token ID 和 logprobs,把 10 个现成 harness 变成 RL 训练环境。
> 相关链接:技术说明

Cognition 推出 Devin ‘Dreaming’:夜间自动优化记忆图

Devin 新增 ‘Dreaming’ 功能,每晚自动剪枝并链接记忆节点;记忆格式(Git + Markdown)已开源为 Agent Memory Repo。
> 相关链接:发布说明

Cursor SDK 更新:支持运行中干预、子智能体、系统提示替换等

Cursor 新 SDK 支持 mid-run steering(运行中干预)、后台子智能体、可替换系统提示,以及 MCP 工具标注(readOnlyHint/destructiveHint)。
> 相关链接:功能详解

Pi Durable:面向长时多人协作的轻量级智能体引擎

Earendil 推出 Pi Durable,核心仅 15K 行 TypeScript,支持智能体挂起/恢复、SQLite/JSONL 存储,运行于 Bun 或 Cloudflare Durable Objects。
> 相关链接:项目介绍


基础设施与硬件

llama.cpp v0.6.0:支持 Qwen3.8-Flash-Next 与 Metal 加速推测解码

llama.cpp 新版支持 Qwen3.8-Flash-Next,Metal 后端推测解码提速至 110 tok/s(M3 Ultra),比普通解码快 3.4 倍。
> 相关链接:发布日志

Alibaba T-Head 发布 Zhenwu V900:216GB 显存,Q1 2027 量产

阿里平头哥 Zhenwu V900 芯片拥有 216GB 内存和 1200GB/s 互联带宽,宣称性能达寒武纪 MLU890 的 3 倍,将于 2027 年一季度量产。
> 相关链接:SemiAnalysis 分析


研究与方法

Verification over sampling:用验证器替代采样提升终端任务准确率

NVIDIA 和 Google 分别推出命令验证方法:GPT-5.6 Sol 验证器将 TerminalBench-Lite Pass@1 从 50% 提升至 68%;Gemini 3.5 Flash + VeriHarness 提升 6.2 分。
> 相关链接:NVIDIA 方法总结|Google VeriHarness

PAIR:用重放机制识别并修复有害上下文压缩

PAIR 方法通过重放智能体行为定位压缩导致的错误,再重写压缩提示词,使性能接近不压缩水平。
> 相关链接:论文链接

Dust:零阶优化法挑战反向传播,预训练效率高千倍

Dust 使用激活扰动“虚拟种群”进行优化,声称在 Transformer 预训练中接近甚至超越反向传播,计算效率高 1000–10000 倍。
> 相关链接:技术线程


产品与应用落地

OpenAI Codex 日更承诺:28 天内每天提速或重置

Codex 负责人 Tibo 承诺连续 28 天每日改进,首日 GPT-6 Astra 和 6.1 Sol 默认速度提升约 50%(30→50 TPS),覆盖所有订阅和 ChatGPT 合作伙伴。
> 相关链接:承诺原文|首日效果

ChatGPT 取消自定义 MCP 服务器开发者模式限制

用户现在无需开启开发者模式即可接入自定义 MCP(Model Control Protocol)服务器。
> 相关链接:官方说明


行业与公司动态

AMD 据报以 82 亿美元收购 World Labs

据 DL Weekly 报道,AMD 已达成协议,以约 82 亿美元收购计算机视觉与 3D 地图初创公司 World Labs。
> 相关链接:报道摘要

腾讯租用超 10 万颗先进芯片,年均约 14 亿美元

据《金融时报》报道,腾讯向 Oracle 租用东南亚数据中心约 10 万颗先进 AI 芯片,五年总成本约 70 亿美元(年均约 14 亿)。
> 相关链接:FT 报道摘要


政策、治理与安全

OpenAI 将在欧盟为 ChatGPT/Codex 文本添加隐形水印

OpenAI 宣布依据欧盟 AI 法案,在欧盟地区对 ChatGPT 和 Codex 生成文本添加统计水印;全球 API 用户可选择开启,但翻译或改写会破坏水印。
> 相关链接:官方公告

Bengio:近期智能体漏洞不是简单沙箱问题,需独立安全标准

Yoshua Bengio 在《金融时报》撰文指出,近期智能体越狱事件暴露深层对齐风险;他援引民调称 86% 公众支持建立独立 AI 安全标准。
> 相关链接:Bengio 专栏

前 OpenAI 研究员 Joshua Achiam 呼吁禁止特定自主武器

Joshua Achiam 呼吁像禁化武一样禁止某些高自主性武器系统,并宣布加入未来生命研究所(FLI)和人工智能前沿(FAI)任研究员。
> 相关链接:推文原文




评论