模型与能力
Meta Muse Spark 1.3 发布:编码与智能体任务新标杆,开放权重将至
Meta 推出 Muse Spark 1.3,称其为 Spark 系列中最强的编码与智能体模型,长上下文(512k–1M tokens)准确率达 98.1%,已进入全球模型榜前三。官方确认开放权重版本「即将发布」,当前已支持复杂指令、长周期任务和高合规性。
> 相关链接:Latent Space 报道|Reddit 用户实测与讨论
阿里巴巴 Wan 3.0 登顶视频生成榜单:支持 30 秒 1080p 多模态编辑
Wan 3.0 在第三方榜单拿下视频编辑带音频第 1、文生视频带音频第 2、图生视频带音频第 5。支持文本/图像/视频/音频/文档/网页多输入,原生音频生成,最高 30 秒 1080p 输出,公测价 $0.05–$0.20/秒。
> 相关链接:Artificial Analysis 榜单
Qwen3.8-Max 登顶 Code Arena WebDev 榜首,本地 27B 版本实测胜过 ChatGPT 5.1 编码体验
Qwen3.8-Max 在 Arena AI Code Arena WebDev 榜单以 1691 分排名第一,小幅领先 Claude Opus 5 Max;用户实测本地运行 Qwen3.8-27B(GGUF),配合上下文文件可直接产出可用代码,无需云端、不传数据。
> 相关链接:Reddit 原帖
Spark-X2.5-4B:40 亿参数模型宣称媲美 90 亿参数竞品,原生支持 100 万 token 上下文
XHToken 开源 Spark-X2.5 系列(1.7B/4B),采用混合注意力架构,宣称在 4B 参数量级达到 Qwen 类 9B 模型性能,预训练达 20T tokens,原生支持 1M context,GGUF 已发布但需定制 llama.cpp 分支运行。
> 相关链接:Reddit 讨论
Google Gemini 3.8 Flash Cyber 发布:专注网络安全,CyberGym 得分 86.2%
Google 推出 Gemini 3.8 Flash Cyber,主打安全领域:CyberGym 86.2%、CWE-Bench 补丁任务 47.2%、内部漏洞发现测试跨 20 种语言成功率超 70%,保持 Flash 级速度与定价。
> 相关链接:官方宣布
Agent 与工具链
斯坦福两门新课落地:从「提示工程」转向「系统级智能体工程」
斯坦福推出两门 Agent 专项课:《The Modern Software Developer》85% 内容重制,聚焦 agent 技能、MCP 门户、背景并行 agent;CS329Z《Engineering AI Agents》则要求学生从零构建 agent 系统,含记忆、工具调用、编排与生产约束。
> 相关链接:Mihail Eric 宣布|Diyi Yang & Michael Ryan 宣布
ByteDance Seed HarnessDev:让模型自己写并优化执行「骨架」,写作/ML 实验已超人类
HarnessDev 方法让模型先生成可运行的弱 harness,再用下游反馈迭代优化,评估兼顾能力与执行 token 成本。在写作和 ML 实验任务上,自建 harness 已超越成熟人工方案;但在代码/搜索/研究任务仍落后。
> 相关链接:论文解读
SGLang + Baseten + NVIDIA 推出 Miles:开源 RL 后训练即服务框架
Miles 是一个开箱即用的 RL 后训练框架,用 SGLang 做 rollout 推理引擎,支持更快更稳的 RLHF/RLAIF 流程,定位为可复用的基础设施,替代各公司自建 pipeline。
> 相关链接:SGLang 官方公告|Arav Srinivas 解读
基础设施与硬件
Photon 2.1 支持实时语音合成与 NVIDIA B200,Baseten 上线 GLM-5.3 Fast 实时部署版
Photon 2.1 新增 TTS 模型与 B200 GPU 支持,专为实时多模态推理优化;Baseten 同步上线 GLM-5.3 Fast 托管服务,强调更高 TPS 和低延迟部署能力。
> 相关链接:Photon 更新|Baseten 公告
llama.cpp 新版 MTP 优化:Qwen3.8-Flash-Next 推理速度提升超 50%
llama.cpp PR #28123 合并后,Qwen3.8-Flash-Next-GGUF 的 MTP(多 token prediction)吞吐量从 123→183 tok/s(代码)、83→144 tok/s(散文),此前散文场景 MTP 反而比普通解码还慢。
> 相关链接:PR 详情
研究与方法
「循环 Transformer」不是黑盒推理:层复用只是压缩计算,不等于隐藏思维链
rasbt 拆解 OpenAI Astra 架构传闻指出,「循环/层复用」本质是类似 Nanbeige 4.2-3B 的轻量设计:22 层重复两次≈44 层效果,内存不变、算力翻倍、token 效率部分保留;它不自动抹除 CoT,只是减少中间 token 输出。
> 相关链接:技术解析
技能检索可能「拉高平均分,却拖垮实际触发任务」:新评测法揭示负向效应
新论文提出「检索触发真实使用效应」评测法:同一任务跑两次(开/关技能),只统计技能真正触发的任务。结果发现:17 个模型中,技能开启后整体分上升,但被触发任务的实际表现反而下降。
> 相关链接:DAIR AI 总结
产品与应用落地
Palmimo DevKit 发布:Python 几行代码就能控制的开源桌面机器人平台
Palmimo DevKit 是一款开源 AI 机器人套件,含可更换 AI「大脑」模块,开发者无需机器人专业背景,用几行 Python 就能控制机械臂/传感器等实体动作,面向物理 AI 应用快速验证。
> 相关链接:官方发布
Wan 3.0 支持最多 14 个参考素材(图/音/角色),@标签式多资产创意控制上线
Wan 3.0 新增 prompt 中 @ 标签引用功能,单次视频生成最多支持 14 个参考:包括图像、声音样本、角色设定等,让多素材协同创作更直观,降低复杂编辑门槛。
> 相关链接:功能演示
行业与公司动态
Marin 535B-A23B 大模型训练完成 13%,由黄仁勋夫妇基金会资助,CoreWeave 提供算力
斯坦福 Percy Liang 团队主导的开源大模型 Marin 535B-A23B 已完成 13% 训练,全部算力由 Jen-Hsun & Lori Huang 基金会捐赠,托管于 CoreWeave 集群,标志大型开源模型可持续获公益算力支持。
> 相关链接:Percy Liang 公布
政策、治理与安全
开发者吐槽 Google 工具链风险:Gemini 账号封禁可能连坐 Google Cloud 账户
多位开发者指出,Google 对 Gemini 工具调用账号管控严格,违规易触发 Gmail/Workspace 封禁,且因身份绑定,连带影响关联的 Google Cloud 生产账户,造成业务中断风险。
> 相关链接:Theo 分析|QuinnyPig 补充