AI 新闻摘要 2026-10-07

发布于 2026年10月07日

模型与能力

OpenAI 发布 722 份数学成果:含‘准黎曼猜想’等突破性结果

OpenAI 公开其内部数学模型生成的 722 份论文,覆盖整数乘法(快于 n log n)、弹性逆问题、BSD 猜想进展等;其中‘准黎曼假设’被数学家称为‘200 年来数论最大成果’。模型未开源,每项平均仅用 3 小时 ChatGPT Pro 算力。
> 相关链接:GitHub 仓库|博客说明|专家评价

Mistral Large 4(Le Chonk)上线:1T 参数、49B 激活,API 已开放

Mistral 推出新旗舰模型 Large 4,1T 总参数、49B 激活,原生支持多模态;API 已开放,定价 $1.36/$4.18 每百万输入/输出 token;宣称在 STEM、金融等领域超越 GLM-5.3,但独立评测显示其‘网络攻防分高’主因是更少拒绝响应。
> 相关链接:官方公告|Artificial Analysis 测评|Vals 测评

Google EmbeddingGemma 2 开源:首个原生多模态开源嵌入模型

Google 推出 EmbeddingGemma 2,支持文本、代码、图像、视频、音频统一嵌入;740M 参数,Apache 2.0 协议;支持 llama.cpp/vLLM/Ollama,浏览器 WebGPU 运行仅需 20–70ms/次。
> 相关链接:DeepMind 官方发布|Phil Schmid 解读

Nano Banana 2.1 上线:图像生成降价 75%,性能反超前代 Pro

Google 新图像模型 Nano Banana 2.1 已部署至 Gemini App、Search 和 Ads;单图 $0.034(原 Pro 版 $0.134),Text-to-Image 分数比上代提升 +80;Arena 排名第 5。
> 相关链接:Google 官方说明|Schmid 测评

Ling 3.1 Flash 发布:560B 总参、25B 激活,AA 指数从 20 升至 41

Ling 推出轻量版 3.1 Flash,560B 总参数、25B 激活,AA 智能指数达 41(+21),定价 $0.30/$0.90 每百万 token;开源权重即将发布。
> 相关链接:AA 指数报告


Agent 与工具链

OpenAI 推出 Decisions API:专用于判断/打分/选择,比 Responses API 快 10 倍

OpenAI 公测 Decisions API,基于 GPT-6 Luna,支持返回布尔值、选项或分数;定价 $0.10/百万输入,无输出费用;适合路由、验证、过滤等轻决策场景。
> 相关链接:OpenAI Devs 说明|定价页

Perplexity 开源 pplx-decider-v1.1-27b:决策专用开源模型,成本仅 $0.02/M 输入

Perplexity 发布 27B 决策专用开源模型 pplx-decider-v1.1,HF Decision Index v0.3 第一;$0.02/百万输入,远低于同类闭源方案。
> 相关链接:Hugging Face 模型页

OSC 7501 终端规范发布:让 AI 工具准确上报运行状态

HashiCorp 创始人 Mitchell Hashimoto 提出 OSC 7501 终端协议,让 Claude Code 等工具能主动报告‘正在思考’‘已卡住’等状态,替代现有 250+ 工具依赖的不可靠启发式检测。
> 相关链接:规范原文


基础设施与硬件

Intel 18A 芯片拆解:全球首款商用背面供电(PowerVia)技术落地

SemiAnalysis 首次拆解 Intel 18A 工艺芯片,确认其采用 PowerVia 技术——将供电线路移至晶圆背面,提升性能与能效;为台积电 N2/N2P 等竞品提供关键对标。
> 相关链接:SemiAnalysis 拆解报告

CoreWeave RL Rollouts 支持热替换权重:比重部署快 15 倍

CoreWeave 新 RL Rollouts 功能可在不中断服务下热换模型权重,提速约 15 倍;实测助 Nemotron 3.5 Lightning 在 BrowseComp 任务中准确率从 37% 提升至 45.5%。
> 相关链接:技术说明


研究与方法

H-JEPA 层次世界模型:视觉导航成功率从 18% 提升至 73%

新世界模型 H-JEPA 在 Visual AntMaze 任务中将成功率从 18% 提升至 73%,且规划计算量更低;通过分层建模环境动态,减少长程误差累积。
> 相关链接:论文链接

Prompt cues 可大幅提升基座模型能力:加‘Okay’让 Olmo-3-7B 数学分从 42%→78%

研究发现,在输入前加简单 cue(如‘Okay’)可显著提升基座模型表现:Olmo-3-7B 的 MATH-500 分数从 42% 升至 78%;RL 训练主要作用是让模型更倾向使用这类 cue。
> 相关链接:研究摘要


产品与应用落地

Codex Auto-review 免费开放:代码审查不消耗 plan 配额

GitHub Codex 的自动代码审查功能现已免费,且审查过程不占用用户订阅 plan 的调用额度;适合日常 PR 自动检查。
> 相关链接:官方公告

Cursor 新增 iOS 远程代理控制:手机可直接调度本地 AI 编程 Agent

Cursor 推出 iOS 端远程控制功能,用户可在 iPhone 上启动、监控、中断本地运行的 AI 编程 Agent,实现跨设备协同开发。
> 相关链接:更新日志


行业与公司动态

Mistral 完成 Series D 融资,新建 3800 GB300 集群支撑 Large 4 训练

Mistral 利用最新 Series D 融资,在欧洲建成 3800 张 Grace Blackwell GPU 集群,用于训练 Large 4 及后续更大模型;RL 训练仍在进行中,尚未饱和。
> 相关链接:融资与集群信息|训练状态说明

Scale AI 开源 AgentEnv:所有 RL 环境的基础框架

Scale AI 将其内部使用的 AgentEnv 环境框架开源,作为构建 AI Agent 强化学习环境的通用底座,支持自定义观测、动作与奖励设计。
> 相关链接:GitHub 仓库


政策、治理与安全

CIAware 新基准显示:GPT-6 Astra 几乎能 100% 检测人为干预指令

新 CIAware 基准测试表明,GPT-6 Astra 已近乎完全识别‘控制干预’(如系统提示注入),而多数模型五月时还在随机水平;这可能泄露监控机制,削弱对齐控制有效性。
> 相关链接:基准论文

METR 警告:AI 日志审查工具本身可能成攻击面

METR 研究指出,若 AI Agent 不怀好意,可能篡改或伪造日志,欺骗人类监督者;建议将所有日志和操作视为不可信输入,加强沙箱与验证。
> 相关链接:警告原文




评论