AI 新闻摘要 2026-10-01

发布于 2026年10月01日

模型与能力

Gemini 4 Argon 发布:1M 输出上限、13 项基准第一,但仅限网络安全预览

Google DeepMind 推出 Gemini 4 Argon,宣称在 19 个主流基准中拿下 13 个第一(如 DeepSWE 77.9%),支持最高 100 万 token 输出(需启用 Long Decode Continuation 功能),但目前仅向政府及可信网络安全团队开放(Fairwind 计划),未对公众或开发者开放。
> 相关链接:官方发布|评测汇总

GPT-6.1 Sol 登顶 MathArena,推理快 8 倍但 Agent 任务只快 2–4 倍

OpenAI 新模型 GPT-6.1 Sol 成为 MathArena 排行榜第一;实测生成速度达约 300 token/s(比前代快 8 倍),但因工具调用延迟主导,端到端 Agent 任务仅提速 2–4 倍;已修复 Luna 图像编码 bug,智力指数+1。
> 相关链接:MathArena 榜单|实测报告

GLM-5.3 被曝具备强自主攻防能力,简单 jailbreak 即可绕过拒绝

Zhipu 的开源模型 GLM-5.3 在 ExploitBench 上实现 50/410 端到端漏洞利用,接近 Claude Mythos 水平;简单提示词即可让拒绝率从 100% 降至个位数,被 Anthropic 警示为‘高风险可获取模型’,但安全从业者称其是实用的本地渗透测试工具。
> 相关链接:Anthropic 风险警示|社区讨论

Ideogram 4.5 开放权重:十次连续编辑后 94–99% 原内容不变

Ideogram 发布图像编辑模型 4.5,主打‘无 artifact 多轮编辑’,十次连续修改后未触碰区域保持率高达 94–99%,已开源权重,Image Edit Arena 排名第 18(1351 分)。
> 相关链接:官方公告|编辑保真度测试

Cohere Embed 5 上线:Pro/Fast 共享嵌入空间,Fast 比 Pro 便宜 1/3

Cohere 推出 Embed 5 系列,Pro 和 Fast 版本使用同一嵌入空间(可混用索引与检索);Fast 版本在成本上比 Pro 低约 33%,且在同类快速模型中得分高至少 6 分。
> 相关链接:官方说明|评测细节


Agent 与工具链

OpenAI DevDay 推出 dots:带专属云电脑的持久化 Agent

OpenAI 在 DevDay 发布 dots——可长期运行、自带云计算机的 Agent;同时上线 Decisions API 和 UI 自动操作能力(Computer Use),ChatGPT Sites 现支持部署 MCP 服务器并转为插件。
> 相关链接:产品介绍|MCP 插件支持

Cloudflare 重构 Agent 容器:首屏交互快 6 倍,648ms 达成 p50

Cloudflare 重写容器系统专为 Agent 优化,p50 首屏可交互时间降至 648ms(原 4s),支持快照功能(beta 中);其 AutoRouter 模型路由在内部测试中降低约 30% 推理支出。
> 相关链接:技术发布|AutoRouter 效果

Meta 发布 Context Language Models(CLMs):上下文可编辑而非追加

Meta 新模型 CLM 把上下文当‘可编辑文件’而非‘只读日志’,上下文管理策略内建于模型权重中,无需外部框架;在多仓库 Agent 协作任务中,同等算力下性能提升 65%。
> 相关链接:论文介绍|性能验证


基础设施与硬件

Cognition 在 Vera Rubin 集群跑 AI:吞吐量达 GB200 的 4.8 倍

Cognition 成为首个在 CoreWeave 的 Vera Rubin 集群上运行大模型的客户,实测解码速度与 GB200 相当,但 token 吞吐量高出约 4.8 倍。
> 相关链接:官方确认

DeepSeek 开源 Ascend 工具包:适配华为昇腾 950 芯片

DeepSeek 发布开源 Ascend 工具包,含 TileLang 编译器,专为华为昇腾 950 优化,支持本地高效运行 DeepSeek 模型。
> 相关链接:GitHub 仓库

AI 编译器直接将 Triton 翻译为 PTX:B200 上 FlashAttention 加速 1.37x

新编译器能将 Triton 代码直接转成 NVIDIA PTX 指令,并内置验证器检查竞态与死锁;在 B200 上使 FlashAttention 实际运行快 1.37 倍。
> 相关链接:技术细节


研究与方法

TaH2 方法:让模型自己决定哪些难 token 值得重算,准确率+3.4pp

TaH2 通过‘前瞻深度监督’教模型识别关键 token 并主动重计算;在相同测试算力下,准确率提升 3.4 个百分点,训练缩放斜率更陡(+53%)。
> 相关链接:方法介绍

Meta AutoBenchmark:人工参与题设阶段,比纯 AI 生成基准更难更准

Meta 新项目 AutoBenchmark 发现:人类在题目构思阶段介入,生成的评测集难度更高、泛化性更好,且能有效区分不同模型能力。
> 相关链接:项目说明

Nature 论文:首个超人类 Stratego AI,靠强化学习+测试时算力突破不完全信息

新 Stratego AI 在不完全信息博弈中首次超越人类顶尖水平,核心是结合强化学习与动态分配测试时算力,解决隐藏状态推理难题。
> 相关链接:论文链接


产品与应用落地

Perplexity 推出 pplx-embed-v2-context-9b:上下文召回率@10 超 Voyage 14.4 分

Perplexity 新嵌入模型在 turbopuffer 私有上下文评测中,答案召回率@10 比 voyage-context-4 高 14.4 分,仅用 1KB int8 向量(Voyage 用 8KB)。
> 相关链接:Hugging Face 页面|评测对比

Solar Mini 4:35B 总参 / 3B 活跃参,Intelligence Index 24 分,但缓存命中率仅 48%

Upstage 发布轻量模型 Solar Mini 4,总参数 35B(活跃 3B),智力指数 24 分;因缓存命中率仅 48%(Luna 达 99%),单任务成本仍是 Luna 的约 5 倍。
> 相关链接:性能报告|缓存分析


行业与公司动态

Factory 解雇顾问 Chris Degnan,称其向 Cognition 泄密;Cognition 当日聘其为 CRO

Factory 指控顾问 Chris Degnan 在担任其董事期间向竞争对手 Cognition 泄露信息,随即解雇;Cognition 同日宣布聘其为首席营收官(CRO);Cognition CEO 否认存在信息共享,并称 Degnan 已提前辞职。
> 相关链接:Factory 声明|Cognition 回应

OpenAI 年化营收近 700 亿美元,正洽谈 300 亿美元融资,估值 1.4 万亿美元

据《纽约时报》报道,OpenAI 年化营收逼近 700 亿美元,正在推进 300 亿美元新融资,投后估值约 1.4 万亿美元,IPO 时间推迟至明年。
> 相关链接:NYT 报道

Flow 完成 5000 万美元 B 轮融资,估值 7.5 亿美元,专注硬件工程 AI 工具

Flow 公司获 5000 万美元 B 轮融资,估值 7.5 亿美元,产品聚焦芯片设计、PCB 布局等硬件工程场景的 AI 协作工具。
> 相关链接:融资公告


政策、治理与安全

OpenAI 发现 1.6 万次隐藏推理提取攻击,涉 4000+ 用户,源头疑与 Moonshot AI 有关

OpenAI 检测到两天内超 1.6 万次针对隐藏推理链的提取攻击,来自 4000 多个账户;溯源指向与 Moonshot AI 关联的个人;攻击在 Astra 上持续有效,补丁难同步至第三方。
> 相关链接:事件通报|安全分析

SynthID Bio 发布:Nature 论文公开 AI 生成蛋白质水印技术,工具已开源

Google DeepMind 与 Nature 合作发布 SynthID Bio,为 AI 生成蛋白质结构提供可验证水印,相关算法与工具全部开源。
> 相关链接:Nature 论文

Opus 5.5 和 Astra 可绕过 Pangram AI 检测器:重写超 50% 文本即不被标记

Vals 测试显示,Claude Opus 5.5 和 Gemini Astra 能通过改写超过一半原文内容,成功规避 Pangram AI 生成内容检测器。
> 相关链接:检测对抗报告




评论