模型与能力
阿里发布 Qwen3.8-Max:2.4T 稀疏 MoE 模型,下周开源权重
阿里巴巴推出旗舰模型 Qwen3.8-Max(2.4T 参数,约95B激活参数/Token),主打长周期编码、芯片设计、电商策略和原生多模态规划。明确承诺下周开源权重,并同步开源 Qwen3.8-27B。
> 相关链接:官方公告|Latent Space 报道
Qwen3.8-Max 登顶多项第三方榜单
Frontend Code Arena 排名第4(1668 Elo),Vision Arena 第2(1305分),Vals Index 开源模型第2(66.1分);SWE-bench 达87.3%,超 GPT-5.5 和 GLM-5.2。
> 相关链接:Arena 榜单|Vals AI 测评
API 定价下调:输入 $2 / 输出 $6 每百万 token
Qwen3.8-Max API 价格从上一代的 $2.5/$7.5 降至 $2.0/$6.0,另收 $0.25/百万缓存 token —— 对需反复读取代码库或指令前缀的 Agent 场景更友好。
> 相关链接:官方定价说明|Vals 对比分析
1M 上下文 + 128K 输出长度,支持超长工作流
实测支持 100 万 token 上下文和单次 128K 输出,适合整仓库分析、多日自动化任务和复杂业务模拟(如 MerchantBench 365 天电商仿真)。
> 相关链接:Vals 技术参数|MerchantBench 介绍
Agent 与工具链
Cloudflare 推出 @cloudflare/computer:隔离容器化 Agent 运行时
为每个 Agent 动态分配独立 Linux 容器或轻量隔离环境,解决沙箱安全与资源隔离难题,适合高权限工具调用场景。
> 相关链接:官方发布
Cursor 新增 Google Workspace 插件:Gmail/Drive/Calendar/Docs/Sheets 全接入
Coding Agent 可直接操作 Gmail 收件箱、Drive 文件、日历事件和 Docs 文档,实现「写代码+管工作」一体化。
> 相关链接:Cursor 官方推文
LangChain 管理型 Deep Agents 进入公测
提供内置记忆、OAuth 工具授权、多渠道集成(Slack/Teams)、自动评估和沙箱运行能力,降低长周期 Agent 部署门槛。
> 相关链接:LangChain 公告
Hermes Agent 发布 Herald 版本:支持语音聊天、桌面插件、A2A 协议
新增语音交互、本地桌面功能(如截图/文件管理)、跨 Agent 协作协议(A2A)、外发 Webhook 和研究技能,token 效率提升显著。
> 相关链接:Teknium 更新日志
基础设施与硬件
Photon 2.0 发布:将 Qwen3.5/Gemma4/Moondream 编译为全图 GPU 内核
通过 DSL 描述数据流,自动生成覆盖整个前向传播的「megakernel」,跳过传统 kernel 调度开销,提升稀疏 MoE 模型推理效率。
> 相关链接:Vikhyat 公告
TokTier 解决 Agent 场景 Tokenization 瓶颈:TTFT 降 16–34%
针对长对话 Agent 的缓存前缀复用场景,提供状态化 tokenization 服务,增量修复速度比 HF tokenizer 快 437 倍。
> 相关链接:Omar Sar 技术分享
研究与方法
Intology Locus 实现自动后训练超越人工:Qwen3 1.7B 基座版反超官方 Instruct 版
其自动化后训练系统 Locus 在 PostTrainBench 上 SOTA,并让 Qwen3 1.7B-Base 版本在 Kaggle 比赛中达平均第4名(16天)。
> 相关链接:Intology 原始报告
新论文梳理 41 类 Agent 失败模式,按交互边而非模块归因
将失败根源定位到模型-用户、模型-工具、工具-内存等 6 类交互边界,人类标注一致性 κ=0.76,推动故障诊断标准化。
> 相关链接:Omar Sar 引用
产品与应用落地
Google Gemini Spark 上线自动浏览:Chrome 登录账号内执行事务,敏感步骤需用户确认
Agent 可在用户已登录的 Chrome 环境中完成订餐、查账等操作,不依赖网页截图或 OCR,直接 DOM 操作,安全性更高。
> 相关链接:Google 官方更新
LiteParse 实现毫秒级结构化 PDF 解析:支持表单/复选框/注释/矢量图/文字坐标
无需调用视觉模型,直接提取 PDF 中所有结构化元素,简单页面处理仅需几毫秒/页,大幅降低文档理解成本。
> 相关链接:LlamaIndex 更新
行业与公司动态
MiniMax H3 成为首个登顶 Video Arena 的开源视频模型
H3 在 Arena 视频榜单排名第一,领先第二名开源模型 280 分;支持文本/图像/视频/音频多模态输入,RTX 5090 可跑。
> 相关链接:Arena 榜单
Sakana 发布 Namazu API:专注日语场景的 Kimi 衍生模型
基于 Kimi 微调,优化日语文化表达、商务术语和低拒绝率,在日本本地应用中减少无谓拒答和偏见。
> 相关链接:Sakana Labs 公告
政策、治理与安全
白宫召集 OpenAI/Anthropic/Google/Meta 审查新自愿 AI 框架
美政府正推进新一轮 AI 自愿安全标准,涵盖网络安全测试、红队演练和漏洞披露流程,四大厂商参与框架制定。
> 相关链接:Steph Palazzolo 报道
Epoch 报告:7 月披露高危 CVE 数达 2500 个,是历史均值 5 倍
激增主因是 Anthropic 等公司启用 AI 自动漏洞挖掘,暴露大量旧有组件风险,凸显供应链安全治理紧迫性。
> 相关链接:Epoch AI 研究简报