模型与能力
DeepSeek-V4-Flash-Vision-Exp 正式发布:支持图文混合输入,性能接近 Opus-4.8
DeepSeek 推出 V4-Flash-Vision-Exp,保留原有文本推理能力,新增多模态支持;图片按 117–384 token 计费,沿用 Flash 定价;实测在 Agents’ Last Exam 等多模态任务上逼近 Opus-4.8。
> 相关链接:官方发布|技术细节与 API 文档
OpenAI 大幅下调 GPT-5.6 Sol 价格:API 和信用产品降价超 20%
GPT-5.6 Sol 在 API 和信用购买渠道降价超 20%,持续三个月;叠加 Codex 50% 折扣、Devin 平台折后达 76% off,明显针对中国低价模型竞争。
> 相关链接:OpenAI 官方公告|Cognition 平台折扣说明
Qwen3.8-27B 局部实测:本地跑出强代理能力,但知识回忆明显退化
RTX 3090 上量化运行 Qwen3.8-27B,能自主登录校园系统、下载视频+抽帧+转录+增强;但离线问答(如冷门历史/地理)比 Qwen3.6 显著变差,属有意权衡——重工具调用,轻事实存储。
> 相关链接:本地代理演示帖|知识退化分析
Agent 与工具链
GitHub 推出 Slack/Teams 协作代理工作流:Devin 风格自动开 PR、拉设计进频道
GitHub Agent 现可在 Slack 和 Teams 中直接响应任务、创建 PR、邀请设计师协作;流程完全嵌入聊天界面,无需跳转,已上线企业版。
> 相关链接:Slack 集成公告|Teams 集成公告
Hermes Agent 开放 Ox Alpha 模型 + 新增‘白板模式’和自动技能裁剪
Hermes Agent 迅速集成神秘强模 Ox Alpha(后证实为 DeepSeek-V4-Flash-Vision-Exp),并推出 Blank Slate 模式(清空历史上下文重试)和自动识别/禁用无效工具技能功能。
> 相关链接:Ox Alpha 集成公告
vLLM 推出 IsoExec:解决 RL 推理中浮点不一致导致的 logprob 偏差问题
vLLM 新模块 IsoExec 强制在不同并行策略(TP/EP/SP)下输出严格一致的 logprob,将 Qwen3.5-35B-A3B 的误差从 1.6e-2 降至 6.7e-7,代价仅 25.3% 开销。
> 相关链接:IsoExec 技术说明
基础设施与硬件
16×RTX 5060 Ti 16GB 推理集群实测:DeepSeek-V4-Flash 达 100–150 tok/s(单用户)
有人用 16 块 RTX 5060 Ti(16GB)+ 双 PLX88096 PCIe 交换芯片搭建 vLLM 集群,单用户生成速度 100–150 tok/s,16 用户并发峰值达 727 tok/s;显存占满但 PCIe 带宽受限。
> 相关链接:集群监控截图
FreeToken 实现消费级显卡高效推理:RTX 4060(8GB)跑 Qwen3.6-35B 达 39.3 tok/s
UC Berkeley 新框架 FreeToken 让 Qwen3.6-35B 在 RTX 4060(8GB)上跑出 39.3 tok/s,GLM-5.2(753B)在 RTX PRO 6000 上达 14.9 tok/s,宣称比 Ollama 快 2–4 倍。
> 相关链接:FreeToken 技术介绍
研究与方法
DeepMind Recirculation:推理时回传深层激活到浅层,不重训即降 60% 上下文错误
DeepMind 新方法 Recirculation 在推理时把深层 layer 的 contextualized 输出反馈给浅层输入,不需重新训练,实测降低 60% 上下文错误、23% 困惑度、提升 21% GSM8K 分数。
> 相关链接:论文讨论帖
Google Pandora Router:把模型路由建模为‘高成本检查’下的最优搜索问题
Pandora Router 不再假设路由评估是免费的,而是建模为带代价的搜索问题,在调用昂贵专家模型更少的前提下,达到与全量评估相当的效果。
> 相关链接:Router 技术介绍
产品与应用落地
Simile 推出人类数字孪生体:基于访谈数据模拟真实用户行为,准确率达 85%
Simile 用两小时访谈生成数字人,能在调查问卷和行为测试中复现本人 85% 的反应,已在 Shopify(购物路径)、腾讯(十亿级 persona)落地,替代部分 A/B 测试和焦点小组。
> 相关链接:Simile 技术说明
NVIDIA AVO 解决全部 183 个 ARC-AGI-3 公开环境关卡,但非完整基准
NVIDIA AVO 在 ARC-AGI-3 的公开教程/演示关卡(共 183 个)达成 100% 通关,但 François Chollet 提醒:这并非正式测试集,完整基准尚未开放。
> 相关链接:AVO 成果公告|Chollet 警告说明
行业与公司动态
Codex 用户破 2000 万,OpenAI 推出‘银行重置’机制应对长周期代理超支
Codex 活跃用户达 2000 万;为应对代理任务耗尽额度(如 Theo 一任务烧 $800),OpenAI 向所有 Codex/ChatGPT Work 用户开放额度‘银行重置’,并新增 API Key 级别支出限额功能。
> 相关链接:用户增长公告|支出控制更新
Marin 535B-A23B 开始训练:11× GB200 NVL72 集群,18.75T token,全程开源透明
Percy Liang 团队启动 Marin 535B-A23B 训练,使用 11 块 GB200 NVL72,预计 3 个月完成 18.75T token 训练;延续一贯风格,训练过程、日志、配置全部公开。
> 相关链接:训练启动公告
政策、治理与安全
社区热议本地代理权限风险:Qwen3.8 自动登录教务系统引安全担忧
Qwen3.8-27B 被曝可利用浏览器 Cookie 自动登录大学教务系统,引发对本地代理获取过高权限(如退课、改信息)的担忧;多位用户强调不应默认赋予生产环境操作权。
> 相关链接:原始演示帖(含登录截图)