AI 新闻摘要 2026-07-31

发布于 2026年07月31日

模型与能力

OpenAI 大幅降价:GPT-5.6 Luna 降 80%,Terra 降 20%

OpenAI 官方宣布 GPT-5.6 Luna 模型价格直降 80%,Terra 降 20%;同时上线 Sol Fast 模式,延迟降低 2.5 倍,价格翻倍但智能不变。
> 相关链接:OpenAI 官方公告AINews 深度分析

Inkling-Small 开源发布:276B 总参、12B 激活,性能接近原版 Inkling

Thinking Machines 推出开源多模态 MoE 模型 Inkling-Small,总参数 276B、每次激活仅 12B,支持图文音联合输入和 Python 图像检查,本地部署友好。
> 相关链接:官方发布vLLM 日零支持


Agent 与工具链

Cursor:云 Agent 贡献 PR 占比从 10% 升至 56%

Cursor 报告显示,2024 年底仅 10% 合并 PR 来自云 Agent,如今已达 56%,主因是给 Agent 配备独立云电脑并允许其持续优化运行环境。
> 相关链接:Cursor 数据披露

Cognition Devin 支持 macOS + Xcode + iOS 模拟器开发

Devin 云 Agent 已能直接在 macOS 环境中调用 Xcode 和 iOS 模拟器,完成原生 iOS 应用的构建与测试,无需本地开发机。
> 相关链接:开发者实测演示

Perplexity 上线 Projects:带持久化‘Brain’记忆的协作工作区

Perplexity 将 Spaces 升级为 Projects,集成共享文件和基于‘Brain’的持久化记忆,定位为多人协同的 Agent 操作系统。
> 相关链接:产品发布


基础设施与硬件

OpenAI 用 GPT-5.6 自动优化 Triton/Gluon 内核,推理成本降 20%

GPT-5.6 Sol 主动分析线上流量、调优负载均衡,并自动重写 OpenAI 自研 Triton 和 Gluon 内核,端到端推理成本下降 20%。
> 相关链接:技术细节说明

Readonflow 团队将 AMD MI355X 性能提升超 2 倍

GPU Mode AMD 内核黑客松中,Readonflow 团队通过底层优化,使 MI355X 显卡端到端性能提升超 2 倍。
> 相关链接:SemiAnalysis 报道


研究与方法

ARC-AGI-3 规则明确:禁止定制 harness,但通用 API 功能可启用

ARC 官方澄清:评测中不得为特定基准定制 harness,但所有用户都能用的通用 API 功能(如响应压缩、上下文截断)可开启,需同步报告设置与成本。
> 相关链接:François Chollet 说明kimmonismus 对比分析

新论文:文件系统式记忆库可降半检索成本,但未提答案质量提升

一项研究发现,用类似文件系统的记忆存储方案可将大规模检索成本减半,但在实验中并未提升最终回答质量,且多数 Agent 管理下记忆质量会退化。
> 相关链接:dair.ai 研究摘要


产品与应用落地

Google Gemini Robotics 2:单模型控制多类型机器人,200 样本即可适配新双臂机器人

Gemini Robotics 2 实现全身体 humanoid 控制、打结/换灯泡等精细操作,并支持多机器人协作;同一 checkpoint 可控多种硬件,新双臂机器人仅需 <200 示例即能适配。
> 相关链接:Google DeepMind 发布技术总结


行业与公司动态

METR 与 OpenAI、Redwood 达成独立审查协议:复盘 Hugging Face 事件模型行为

METR Evals 宣布已与 OpenAI 和 Redwood Research 就 Hugging Face 事件中的模型异常行为达成独立审查协议,范围与初步结论将后续公布。
> 相关链接:METR 官方声明


政策、治理与安全

Simon Willison 批评 OpenAI/Anthropic:搜索依赖深、索引不透明

Simon Willison 指出 OpenAI 和 Anthropic 大量依赖外部搜索引擎,但产品文档未说明具体索引来源与合作方;Anthropic 子供应商名单才暴露其与 Brave、TurboPuffer 的关联。
> 相关链接:批评原文




评论