模型与能力
Meta 发布 Muse Glimmer:30B 开源多模态小模型,专为本地智能体优化
Meta 推出 Muse Glimmer(30B 密集模型),Apache 2.0 开源,支持图文交错输入、100+语言、可控推理强度;量化后仅约 18GB,可在 24–32GB 显存设备本地运行,内置 DFlash 推理加速器,主打‘永远在线’的本地智能体场景。
> 相关链接:Meta 官方模型线程|Hugging Face 下载页
Anthropic Claude 改进黎曼猜想关键下界:从 41.6% 提升至 67.2%
Anthropic 未发布的研究版 Claude 在黎曼假设相关任务中,将临界线上非平凡零点比例下界从 41.6% 提高到 67.2%,耗时生成超 3100 万 token;这不是证明,而是 AI 辅助数学探索的典型实例。
> 相关链接:Anthropic 原始公告
OpenAI 上线 GPT-5.6-Cyber:面向网络安全的专用模型,仅限授权防御者使用
OpenAI 发布 GPT-5.6-Cyber,已用于真实漏洞挖掘(包括 Chrome V8 未知缺陷),但仅开放给‘批准的防御人员’,带额外监控和高风险任务管控,不对外公开。
> 相关链接:OpenAI 官方公告
Anthropic 将 Claude Sonnet 5 定价永久化:$2/百万输入 token,$10/百万输出 token
Claude Sonnet 5 的试用期价格转为长期定价,明显低于同类模型(如 GPT-4 Turbo $10/$30),被广泛视为应对开源模型竞争的价格压力信号。
> 相关链接:Claude 官方宣布
Agent 与工具链
Agent ‘驾驭层’(harness)成新瓶颈:不同框架跑同一模型,性能差可达数倍
Composio 测试显示,DeepSeek V4 Flash 在 Pi Agent 上表现最好且最便宜;Shashwat Goel 指出 Prime-agent 更适合长周期任务——模型强≠Agent好,工具链设计正成为关键分水岭。
> 相关链接:Composio 基准测试
程序式工具调用(Python stub)比 JSON Schema 更准更快:GPT-5.6 系列提升 10.6%
研究发现,让模型直接调用 Python 函数接口(而非解析 JSON schema),在 11/14 模型上效果更好;尤其在上下文混乱或并行调用时,代码优先方式更鲁棒。
> 相关链接:Dair.ai 论文摘要
Pi SDK 证明:只需 read/bash/edit/write 四个原语,就能支撑强大本地编码 Agent
Pi 新 SDK 展示极简工具集可行性——仅靠 4 个基础操作即可完成复杂编程任务;Jerry Liu 的 LiteParse 进一步把文档解析压到 4ms(200页),大幅降低 Agent 循环延迟。
> 相关链接:Pi SDK 文档|LiteParse 技术说明
基础设施与硬件
DFlash 和 DSpark 对比:Meta 用的 DFlash 跑 Qwen3-4B 吞吐达基线 1.96×,DSpark 达 2.55×
vLLM 实测显示,DFlash(Meta Glimmer 所用)和 DSpark 都能加速推理,但 DSpark 因半自回归结构+硬件感知调度,吞吐高出约 30%;说明推测解码正走向生产级成熟。
> 相关链接:ZhihuFrontier 技术总结
同模型不同服务商,响应速度差 15 倍:推理体验高度依赖部署栈
Artificial Analysis 指出,Muse Glimmer 或 DeepSeek V4 Flash 在不同平台实测中,输出速度差异可达 15 倍;QuixiAI 在 4×A100 上跑 DeepSeek V4 Flash 达 175 tok/s(单请求)或 1k tok/s(64并发)。
> 相关链接:Artificial Analysis 分析预告|QuixiAI 性能报告
研究与方法
MiniMax H3 成首个快速落地的开源视频模型:Metal/Mac/LoRA/ComfyUI 全支持
MiniMax H3 视频模型开源后,社区一周内实现 Metal 加速(antirez)、MLX 移植、ComfyUI 插件、LoRA 微调——验证了开放权重对生态迭代速度的直接拉动。
> 相关链接:MiniMax 官方庆祝
Dyna-2 世界模型:用 100 万小时人类视频预训练,可迁移到真实机器人动作
Dyna Robotics 发布 Dyna-2,证明纯人类视频数据能有效泛化到机器人控制;不同目标函数选择显著影响跨形态迁移效果,为具身 AI 提供新训练范式。
> 相关链接:Dyna Robotics 发布
产品与应用落地
Google Gemini Omni Flash 支持多角度视频生成与编辑,fal 已上线 Seedance 2.5 和 H3 LoRA 训练
Gemini Omni Flash 可控生成多视角视频;fal 平台同步开放 MiniMax H3 的 LoRA 微调和 Seedance 2.5 视频 API,参考图、音频、首尾帧控制等已成为标准功能,不再只是演示。
> 相关链接:Google 演示|fal H3 LoRA 功能
行业与公司动态
Meta 宣布重启‘个人超级智能’路线:收购 Dreamer、推出 Muse Spark/Glimmer/Code,开放权重
扎克伯格发布续篇《个人超级智能》长文,强调 Meta 使命是‘把超级智能交到每个人手里’;一年内密集推出 Muse 系列(Spark、Glimmer、Code),并确认 Muse Spark 1.2 将开源。
> 相关链接:扎克伯格续篇 essay|Alexandr Wang 确认 Spark 1.2 开源
政策、治理与安全
扎克伯格提议:前沿 AI 公司应共享训练中间检查点供政府审查,并投入资源加固关键基础设施
Zuck 在文中呼吁 AI 公司向政府开放模型训练过程中的中间 checkpoint,而非只交最终模型;同时承诺技术资源协助政府抵御 AI 在网络、生化等领域的滥用。
> 相关链接:扎克伯格政策建议原文