AI 新闻摘要 2026-08-13

发布于 2026年08月13日

模型与能力

xAI 发布 Grok 4.6:1.5T 模型,专注长时 Agent 和交互式任务

Grok 4.6 是 xAI 新发布的模型,参数量确认为 1.5T,重点强化长时运行 Agent、Web 开发、CAD 和内核优化等任务;训练中使用 Grok 4.5 重生成 SFT 数据,并加入大量工程数据和 agentic RL;性能接近 GPT-5.6 Sol Max,但价格仅 $2/$6 每百万 tokens,显著低于竞品。
> 相关链接:发布信息独立评测(Intelligence Index 61 分)终端任务表现(Terminal-Bench v2.1 达 88.4%)

DeepSeek V4 Pro 正式发布:定价约 $0.435/$0.87 每百万 tokens

DeepSeek V4 Pro GA 版上线,输入/输出单价分别约 $0.435 和 $0.87,据称比 Claude Fable 5 便宜约 57 倍;Terminal Bench 提升 15.8%,但部分用户反馈在编程等任务上未明显超越 Kimi/Flash,后续提升或更依赖 RL 环境而非单纯扩模。
> 相关链接:GA 发布公告价格与性能对比分析

阿里 Qwen3.8-Max 开源:2.4T MoE 模型,95B 激活参数

阿里巴巴开源 Qwen3.8-Max,总参数 2.4T、激活参数 95B 的 MoE 架构模型,首版为纯文本版本(暂无视觉能力);vLLM、Together AI、Baseten 等已支持部署;社区称其为当前最大规模开源权重之一。
> 相关链接:开源发布vLLM 日支持说明

微软推出 MAI-Thinking-1:首个自研推理模型,聚焦工具调用

微软发布 MAI-Thinking-1,号称“从零构建”的推理专用模型,已上线 Foundry 平台;团队明确征集对工具使用(tool use)的反馈,定位为实用型推理模型而非单纯刷榜产品。
> 相关链接:官方宣布用户反馈请求原文

Upstage Solar Pro 4 智能指数跃升:从 14 分升至 42 分

Upstage 的 Solar Pro 4 在 Artificial Analysis Intelligence Index 中得分从 14 升至 42,尤其在长上下文和 Agent 类任务中进步显著,但仍落后于当前顶尖闭源及开源模型。
> 相关链接:评测报告


Agent 与工具链

GitHub 推出 Agent Plugins 1.0:整合技能、MCP 服务器与 AI 扩展

GitHub 正式发布 Agent Plugins 1.0,将技能封装、MCP(Model Control Protocol)服务和 AI 扩展统一打包;同时上线粘性滚动、会话持久化等 UX 改进,降低 Agent 集成门槛。
> 相关链接:发布说明功能详解

Hermes Agent 支持树莓派部署 + 可导出配置文件 + 自动生成 Web API

Hermes Agent 新增树莓派轻量部署、用户配置文件一键导出/导入,以及从网页流量自动提取并生成可复用 API 的新技能,强化本地化与跨平台 Agent 能力。
> 相关链接:Raspberry Pi 支持API 生成技能演示

LangChain 重构 LangSmith 仪表盘:强化 trace 分析与报告能力

LangChain 重做了 LangSmith 的 UI,重点优化了 trace 可视化、调试路径回溯和自动化报告生成,让开发者更容易定位 Agent 执行瓶颈和失败环节。
> 相关链接:更新说明


基础设施与硬件

vLLM 支持 Azure Blob 加载模型 + Blob-backed KV 缓存

vLLM 新增对 Azure Blob Storage 的原生支持,可用于模型加载和 KV 缓存;配合 Dynamo ModelExpress,H100/A100 上权重加载提速最高达 7.3 倍;LMCache + NIXL 方案减少长 prompt 下的重复计算。
> 相关链接:官方 PR性能对比说明

Unsloth 实现 Qwen3.8-2.4T 1-bit 量化:4.9TB → 397GB

Unsloth 将 Qwen3.8-2.4T-A95B 模型通过动态 1-bit 量化压缩至 397GB,使其可在 410GB+ RAM/VRAM 的本地设备运行;同方案下 Nemotron 3.5 Lightning 可在 22GB VRAM 中稳定执行长工具链任务。
> 相关链接:量化成果展示Nemotron 22GB VRAM 运行演示


研究与方法

Direct On-Policy Distillation:RL 策略迁移节省约一半 pipeline 成本

新方法先在小模型上完成 RL 训练,再将策略偏移通过隐式稠密奖励迁移到大模型,实测可将整体 pipeline 成本降低约 50%,适合高成本 RL 场景。
> 相关链接:技术总结

四类架构选择可导致 47% 长上下文性能损失

OLMo/Llama/Qwen 研究指出:归一化方式、GQA、预训练上下文长度、滑动窗口注意力这四项设计,即使短上下文验证正常,也可能造成高达 47% 的长上下文性能下降。
> 相关链接:架构影响分析

DiG-bench 发布:首个面向‘发现’能力的纯文本基准

Princeton/MIT 推出 DiG-bench,不考问答或代码,而是测试模型在开放文本中自主发现规律/模式的能力,被评价为‘有 ARC 风味但避开视觉干扰’。
> 相关链接:基准介绍


产品与应用落地

Google SL2T 上线 Pixel 11:ASL 手语实时转文字,端侧姿态追踪+云端翻译

Google DeepMind 推出 SL2T,首次在 Android/Pixel 11 实现 ASL 手语输入——身体姿态识别在手机端完成,翻译由服务器处理,专为单手签名等真实场景优化。
> 相关链接:官方发布技术细节

Deepgram Flux TTS:80ms 延迟,支持通话中语音风格实时适配

Deepgram 发布 Flux TTS,端到端延迟约 80ms,主打低延迟语音代理场景,并支持在通话过程中动态调整音色、语速等风格特征。
> 相关链接:产品页面


行业与公司动态

Cohere 开源 North Micro Vision:Apache-2.0 小型 VLM,文档理解超越 Gemma 4 E2B

Cohere 开源 North Micro Vision,一款 Apache-2.0 许可的小型视觉语言模型,专注文档理解,在多项视觉基准上超过 Gemma 4 E2B 和 Ministral 3 3B。
> 相关链接:开源公告性能对比结果

Expedia 迁移至 Keras 3:排名模型训练快 30%,推理延迟降 70%

Expedia 将推荐排序模型迁移到 Keras 3,训练速度提升 30%,推理延迟降低 70%;Keras 后端无关特性也降低了未来切换 PyTorch/JAX 的锁定风险。
> 相关链接:技术分享


政策、治理与安全

Anthropic 为 Claude 输出添加隐形水印 + C2PA 元数据

Claude 8月2日起所有新模型默认在文本中嵌入统计水印(基于 token 偏置),并在 PNG/JPG/SVG 等文件中添加 C2PA 数字签名元数据;但文本水印易被 paraphrase 或本地 LLM 洗稿破坏,检测需密钥或可信工具。
> 相关链接:官方说明技术原理讨论

W&B 展示 Agent 安全防护:自动红黑名单过滤 + 敏感信息脱敏

Weights & Biases 演示两个 Agent 对比:一个直接暴露 SSN/银行卡号,另一个在模型输入前主动拦截 prompt 注入、自动红黑关键词过滤并脱敏敏感字段。
> 相关链接:安全对比演示




评论