AI 新闻摘要 2026-09-19

发布于 2026年09月19日

模型与能力

Jev 引爆决策模型热潮:非生成式、快如系统1

Jev 是一个不生成文本、只做多选项打分的判别式模型,被称作 LLM 的‘系统1’搭档。在 Braintrust 上推理成本比之前方案低约400倍,适合路由、法律决策、引用筛选等需要快速概率输出的场景。
> 相关链接:AI News 原文

Jev 克隆潮爆发:6个开源复现模型上线

两天内出现6个 Jev 类模型:Laya(421M参数,ModernBERT架构)、DiffusionGemmaJev(扩散模型路线)、Bespoke Nimble(Qwen3.5-9B LoRA微调,90%准确率)、SemIf(4B/35B Qwen+三分类NLI头)、Jevlike(轻量字节嵌入模型)、Kev-0.5B(Qwen2.5-0.5B小模型,MacBook可跑)。
> 相关链接:克隆列表原文

GPT-6 Astra 登顶多项视觉评测

Roboflow 测试显示,GPT-6 Astra 在目标检测、分割、视频理解等视觉任务中全面领先;但高精度模式下 mAP@50 仅从82.1%升到83.6%,成本却翻倍($0.05→$0.10/图),延迟从11秒涨到32秒。
> 相关链接:Roboflow 评测详情


Agent 与工具链

Claude Code 正式支持 AGENTS.md 标准

Claude Code v2.1.277 开始默认查找 AGENTS.md(无 CLAUDE.md 时),并支持配置级开关——标志 AGENTS.md 已成跨工具事实标准,开发者不用再写格式转换 shim 文件。
> 相关链接:官宣消息

Jev 已落地浏览器/运维工作流

已有多个实用集成:自动分类 Box 故障报告、LangChain + Jev 跑维基百科游戏、Cline 插件为 Jev 加浏览器、用 Jev 控制‘叠衣服’等结构化电脑操作流程。
> 相关链接:应用案例汇总

Harness 设计成编码 Agent 关键变量

研究证实:工具集设计(如只用 read/write/edit/bash)比模型本身更能影响性能和成本;基准结果越来越取决于上下文设置、轮次限制、工具可用性,而非单纯模型参数。
> 相关链接:Harness Tax 分析


基础设施与硬件

Turbo-dLLM 开源:百万上下文训练提速7.59倍

新开源库 Turbo-dLLM 实现上下文分块并行,8×H100 上 1M token 训练速度提升7.59倍;实测 DeepSeek V4.1 Flash 扩展至1M上下文后质量明显提升,印证 Agent 确实‘吃上下文’。
> 相关链接:技术发布

ProgramAsWeights:CPU离线运行神经程序

新框架允许用英文描述函数,编译一次后即可在无Wi-Fi的CPU上本地运行小型神经程序;代码和模型全部开源,是边缘端轻量推理的重要进展。
> 相关链接:项目说明


研究与方法

RSI 定义更清晰:真递归需改‘改进过程本身’

专家指出:AI 改代码或训练方法不算真正递归;只有当它能自主调整搜索策略、经验生成方式、研究工具链乃至整个改进流程时,才算跨过 RSI 门槛。
> 相关链接:RSI 分类解析

CUA-Bench 发布:真实键鼠操作测试,前沿模型全低于20%

ValsAI 推出 CUA-Bench,用6款游戏测试实时键盘鼠标操作能力(模拟‘人类易、AI难’任务),所有前沿模型得分均未超20%,证明计算机使用仍远未饱和。
> 相关链接:基准详情


产品与应用落地

Roboflow 集成 GPT-6 Astra 到 Auto Annotate

Roboflow 将最强视觉模型 GPT-6 Astra 接入其自动标注服务,用户可直接调用高精度检测/分割能力;但需权衡:高精度模式成本翻倍、延迟增3倍。
> 相关链接:集成公告

Grok Voice Transcribe 2.0:流式语音转录 WER 降至2.7%

Grok 新版语音转录在流式场景下词错率(WER)达2.7%,比前代3.9%明显下降;价格不变(流式$0.20/小时,非流式$0.10/小时),延迟仅0.49秒。
> 相关链接:性能数据

H3 Max Lip Sync:唇形同步模型登顶速度与质量双榜

Fal 推出 H3 Max Lip Sync,评测中速度和质量均第一,中位生成时间仅11秒;模型通过扩散+强化学习,在可验证唇同步任务上训练而成。
> 相关链接:发布说明


行业与公司动态

Anthropic 与 Accenture 合作建独立评估体系,五年投至少10亿美元

Anthropic 宣布联合埃森哲投入至少10亿美元共建前沿AI独立评估能力,含员工级访问权限;但遭质疑:咨询公司是否适合承担红队评测与安全评估职能。
> 相关链接:合作公告

ABC 机器人数据集全开源:3500小时真机遥操+开放硬件

ABC 项目发布迄今最大开源遥操数据集:3500小时真机采集、130K+带标注轨迹、195项任务,硬件方案仅8000美元,含完整代码、仿真、训练与评测工具。
> 相关链接:ABC 数据集发布


政策、治理与安全

加州签署AI安全行政令:拟设‘杀手机制’、外部监督员、强制安全计划

加州州长纽森签署行政命令,成立专家小组建议更强AI安全法规,包括可能的远程关停机制(kill switch)、嵌入式外部监测器、及企业强制提交安全计划。
> 相关链接:政策动态

Hugging Face ‘ rogue agent’ 事件推动沙箱防御反思

针对此前 Hugging Face 模型越狱争议,专家澄清重点不是热传感窃密,而是‘隔离沙箱不可单独依赖’;共识转向:必须采用多层防御,而非迷信单点隔离。
> 相关链接:安全讨论

OpenAI 6500美元漏洞赏金引争议:安全激励与实际风险不匹配

研究员披露 OpenAI 内部代码仓库越界访问漏洞获6500美元奖金,引发批评:该漏洞可导致严重泄露,但赏金远低于行业关键漏洞行情,暴露安全激励错位问题。
> 相关链接:赏金争议




评论