AI 新闻摘要 2026-08-12

发布于 2026年08月12日

模型与能力

Meta 发布 Muse Glimmer 30B:开源密集型多模态模型,主打本地智能体场景

Meta 开源 Muse Glimmer 30B(Apache 2.0 许可),300 亿参数密集模型,支持图文输入、100+语言、可控推理强度;实测可在单张 RTX 3090(24GB)运行,KV 缓存仅约 1.8GB(131k 上下文),Q4_K_XL 量化后 VRAM 占用约 22–23GB。
> 相关链接:Hugging Face 模型页官方技术博客

NVIDIA 推出 Nemotron 3.5 Lightning:30B MoE 模型,3B 激活参数,专为智能体常驻任务优化

NVIDIA 发布 Nemotron 3.5 Lightning(31.6B 总参 / 3.6B 激活),支持 100 万上下文、NVFP4/BF16 权重;实测服务吞吐达 670 tok/s,Agentic 基准 GDPval-AA v2 Elo 824,Terminal-Bench v2.1 达 24%,显著优于 Nemotron 3 Nano。
> 相关链接:NVIDIA 官方发布Artificial Analysis 评测

Qwen 3.8-27B 确认本周开源,ModelScope 已上线倒计时页面

阿里 Qwen 团队在 X 平台确认 Qwen3.8-27B 将于本周开源;ModelScope 官方页面显示 Qwen3.8-2.4T-A95B 已上线并带倒计时,被社区视为可信信号;用户期待其在速度与性能间取得新平衡。
> 相关链接:ModelScope 页面Qwen 官方 X 帖子

inclusionAI 发布 Ling-3.0-tiny:8B MoE 模型,仅 1.3B 激活参数,支持 256K 上下文

Ling-3.0-tiny(8B 总参 / ~1.3B 激活)在 IFBench、Multi-IF、BFCL-v4 上均超 LFM2.5 同级模型;DGX Spark 实测 FP8 吞吐 100–105 tok/s,MacBook M4 Pro 达 86–90 tok/s,峰值内存仅 8.34GiB(8K 上下文)。
> 相关链接:Hugging Face 模型页


Agent 与工具链

xAI 推出 Grok Bot:首个可登录第三方工具、持续运行的‘AI 同事’产品

Grok Bot 不是聊天机器人,而是带云电脑的 AI 同事:能自动登录 Slack/GitHub、监控线程、执行定时任务、创建/管理其他 Bot,并跨云环境协同工作,强调持久上下文与身份绑定。
> 相关链接:xAI 官网介绍

Unsloth Desktop 正式发布:开源本地 AI 桌面环境,支持训练/推理/工具调用/沙箱代码执行

Unsloth Desktop 是跨平台(Mac/Win/Linux)开源桌面应用,内置 MLX/GGUF/扩散模型/Audio 支持,宣称训练快 2 倍、VRAM 降 70%;集成 MCP、RAG、私有搜索和 OpenAI 兼容 API。
> 相关链接:GitHub 仓库


基础设施与硬件

Attestable 获 2000 万美元种子轮融资:用 ZK 零知识证明验证 AI 推理完整性

Attestable 提供 ZK 证明,确保‘正确模型在正确输入上执行了正确工具调用’;Vitalik Buterin 评估其开销已降至原始推理的 <10 倍,可用于长链 Agent 追踪审计。
> 相关链接:官网与融资公告

整数确定性推理突破:Qwen3-0.6B 在 A100/H100/M5 Max/EPYC/Xeon 上输出完全一致

研究者用纯整数运算实现跨芯片 LLM 推理确定性:所有平台生成相同哈希 logits;WikiText2 困惑度 20.72(fp16 为 20.95),A100 解码达 106 tok/s,比 fp16 eager 快 3.6 倍。
> 相关链接:技术说明帖


研究与方法

前沿 API ‘加密推理痕迹’可被解码:公开分享的 Claude/GPT/Gemini 思考块已泄露 62 个 API 密钥等敏感数据

研究人员成功解码主流模型 API 返回的‘加密思考块’,扫描 7000 条公开 trace 发现:62 个唯一 API key、33 个邮箱、33 个密码——全部藏在推理块内、未出现在可见对话中。
> 相关链接:论文与披露详情

微软提出‘技能编译’:用前序隐藏状态注入,免费提升多步 Agent 任务表现

微软新方法在解码时复用前一 token 的隐藏状态,无需额外训练;另一研究显示,从历史轨迹蒸馏出的自然语言技能,可在多步任务中恢复 55%–100% 的推理模式差距,且输出 token 减少 2.7–6 倍。
> 相关链接:相关推文汇总


产品与应用落地

OpenAI 推出 ChatGPT Linux 桌面版(预览):支持 Ubuntu/Debian/Fedora,可同步 Codex 技能与插件

ChatGPT 桌面 App 终于登陆 Linux(x64/ARM64),支持 Ubuntu 24.04+、Debian 13、Fedora 43+;最大亮点是能导入/同步其他 Agent 的项目、聊天、技能和插件,并自动更新。
> 相关链接:OpenAI 官方公告

LlamaIndex 发布 ExtractBench:首个企业级文档提取确定性基准,揭示 VLM 在长文档中召回率崩至 35% 以下

ExtractBench 测试 370 份真实企业文档(共 4869 页),发现商用多模态模型在 >50 页文档中召回率骤降主因‘静默截断行/列表’;LlamaParse 新‘Agentic Plus’方案达 95.6% 值准确率,成本仅竞品 1/3。
> 相关链接:Benchmark 详情页


行业与公司动态

Together AI、IBM、NVIDIA 合作推出企业级 AI 推理云服务:部署在 IBM Cloud

三方联合提供托管式大模型推理服务,支持 NVIDIA GPU 加速与 Together 模型栈,面向金融、医疗等需合规与低延迟的企业客户。
> 相关链接:官方联合声明


政策、治理与安全

欧盟合规压力下,多家 AI 实验室正加装文本水印并提供检测 API,但开发者担忧影响代码/文档简洁性

为满足 EU AI Act 等监管要求,实验室开始默认添加不可见水印并开放检测接口;争议点在于:水印可能增加输出长度、破坏代码格式或文档排版,部分团队称熵预算足够实现‘隐形签名’。
> 相关链接:技术讨论汇总




评论