模型与能力
OpenAI 推出 Decisions API:支持概率/列表选择/分级打分,比 GPT-6 文本生成快 10 倍
OpenAI 新增 Decisions API,专为结构化输出设计(如 yes/no、从 A/B/C 中选一个、1–5 分打分),支持图文输入,基于 GPT-6 Luna,$0.10/百万输入 token,无输出收费。
> 相关链接:官方说明|性能对比
Perplexity 发布 pplx-decider-v1.1-27b:决策任务准确率 94.5%,单价 $0.017/千次
Perplexity 推出专用决策模型,在 1071 个测试案例上准确率达 94.5%,价格仅 $0.017/千次调用,目前是公开模型中决策准确率最高者。
> 相关链接:发布推文
StepFun Step 5 预览版上线:27B 活跃稀疏 MoE,1M 上下文,Hermes Index 33.89(追平 GPT-6 Luna)
StepFun 发布 Step 5 预览模型:600B 总参、27B 活跃参数、支持 1M 上下文和多模态;Hermes Index 得分 33.89,与 GPT-6 Luna 持平,免费开放一周。
> 相关链接:评测结果|上下文修正说明
Upstage Solar Mini 4:35B MoE 中 3B 活跃,524K 上下文,AAII 24 分(同档最强)
Upstage 推出 Solar Mini 4,35B MoE 架构中仅激活 3B 参数,上下文长达 524K,AAII 评分为 24,是当前 3B 活跃参数模型中得分最高者,免费开放于 Cline。
> 相关链接:Cline 免费体验
Gemini 4 Argon 首发:DeepSWE v1.1 得分 77.9%(超 Opus 5.5 的 74.2%),优先提供给 650+ 安全研究员
Gemini 4 Argon 在 DeepSWE v1.1 编程评测中得 77.9%,高于 Opus 5.5 的 74.2%;首批仅向 Fairwind 计划的 650 多名安全研究员开放,定价 $2/$10 每百万 token。
> 相关链接:评测对比
Agent 与工具链
Claude Managed Agents 公测:主 Agent 可并行调度最多 1000 个子 Agent,按阶段拆解任务
Anthropic 开放 Claude Managed Agents 公测,主 Agent 能自动生成分阶段计划,并行调用最多 1000 个子 Agent 处理任务,结果自动合并,需注意 token 消耗较高。
> 相关链接:官方公告|使用指南
vLLM Semantic Router 2.0:单次前向即可回答多个问题,并返回各选项概率
vLLM 推出 Semantic Router 决策 2.0,对同一输入可一次性回答多个结构化问题(如‘是否含敏感词?’‘属于哪类?’),并为每个选项输出置信概率。
> 相关链接:技术说明
Prime Agent 用 2000+ Agent 和 200B+ GLM-5.3 Token 自动重写为 Rust:启动快 13 倍,内存占用降 83%
Prime Agent 项目用超 2000 个 AI Agent 协作两周,消耗 200B+ GLM-5.3 tokens,将自身完全重写为 Rust,启动速度提升 13 倍,内存占用减少 83%。
> 相关链接:成果展示
基础设施与硬件
vLLM 在 MiniMax M3 上实现 7.8x GB200 吞吐量(AgentX 场景)
vLLM 团队报告在 MiniMax M3 硬件上运行 AgentX 工作负载时,推理吞吐量达 GB200 的 7.8 倍,关键优化包括 CUDA 13.4 locality-aware MoE。
> 相关链接:性能报告
SGLang 新增 MoE 尾部融合优化:每步解码减少 276 次内核启动,端到端提速 5.9%
SGLang 实现 MoE 尾部融合(tail fusion),单步解码减少 276 次 CUDA 内核启动,在 128K 上下文场景下端到端提速 5.9%。
> 相关链接:技术细节
研究与方法
Apple/CMU 提出 SSR(Selection-based Structured Reasoning):单次前向批量评分 6 种自然语言策略,推理延迟降 90%
Apple 与 CMU 合作提出 SSR 方法,让模型一次前向即完成 6 种推理策略的长度归一化对数似然评分,单步推理延迟下降超 90%,但整题耗时仅降 28–54%。
> 相关链接:论文链接
TRL v1.15 默认启用融合 LM 头:Gemma 3 1B 训练峰值内存降 52–82%,序列长度翻 4 倍
TRL 新版默认开启 fused LM head,避免显存中构建完整 logits 张量;Gemma 3 1B 上 GRPO 序列长度从 28K 提升至 114K,训练最快提速约 11%。
> 相关链接:更新说明
产品与应用落地
Codex 新增 Windows 沙箱模式:基于微软 MXC 容器,启动更快、文件控制更细、网络可强制隔离
OpenAI Codex 推出 Windows 沙箱新版本,底层改用 Microsoft Execution Containers(MXC),相比旧版启动更快、支持粒度更细的文件权限控制和强制网络隔离。
> 相关链接:技术公告
Devin 支持树状嵌套管理:可 spawn 子 Devin 组成分支树,总耗时按最慢分支计算
Devin 新增树状嵌套功能,主 Devin 可动态创建子 Devin 并行执行不同分支任务,整体 wall time 取决于最慢分支而非累加,更适合长流程工程任务。
> 相关链接:功能说明
行业与公司动态
TypeSafe 宣布 Series AI 融资,Sequoia 泄露其首周 ARR 达 1 亿美元
TypeSafe 宣布完成 Series AI 轮融资,风投机构 Sequoia 在非正式场合透露该公司上线首周年化营收(ARR)已达 1 亿美元,引发业内广泛关注与讨论。
> 相关链接:融资公告|Sequoia 泄露信息
政策、治理与安全
LangSmith 用 Jev 作为评估裁判:对每条 trace 同时输出难度与正确性两个结构化判断
LangSmith 将 Jev 模型接入追踪系统,对每个 trace 自动返回两个独立结构化答案:‘该步骤难度等级’和‘答案是否正确’,用于自动化质量审计。
> 相关链接:集成说明