模型与能力
DeepSeek 发布 V4.1 Flash:763B 总参、8B 输入 / 16B 输出激活,MIT 开源
DeepSeek 推出新旗舰模型 V4.1 Flash,总参数约 763B(含 Engram),但仅 8B 参数用于输入(prefill)、16B 用于输出(decode);支持 1M 上下文、文本+图像输入,MIT 许可,API 起价 $0.30/1M 输入 token。
> 相关链接:Latent Space 原文|技术报告
V4.1 Flash 性能:AA 智能指数 40,自动化任务 69%,成本仅 V4 Pro 的 40%
独立评测 Artificial Analysis 测得 AA Index 40(超 V4 Pro 0813,略低于 GLM-5.3-Flash);AutomationBench-AA 达 69%,GDPval-AA Elo 1632;单任务成本仅 $0.27,约为 V4 Pro($0.67)的 40%。
> 相关链接:Artificial Analysis 评测|Vals 评测($0.30/test)
DeepSeek ‘软退役’ V4 Pro:流量自动切至 V4.1 Flash,按 Flash 低价计费
DeepSeek 已停止独立提供 V4 Pro,所有调用自动路由至 V4.1 Flash,并按更便宜的 Flash 定价结算;官方称其在性能、速度、成本和总使用时长上全面优于 V4 Pro。
> 相关链接:软退役公告
V4.1 Flash KV 缓存仅 ~890 字节/Token,SSD 流式运行实测达 300+ TPS
模型通过 Sliding-Window Attention + KV 量化压缩,KV 内存降至约 890 字节/Token;Fraser Price 在 4 张 RTX Pro 上用 SSD 流式加载实现 300+ TPS,峰值系统内存 <32GB。
> 相关链接:Fraser Price 实测|Antirez M5 Max 运行记录
V4.1 Flash 架构本质是‘因果编码器-解码器’,被评应叫 V5
Sebastian Raschka 等指出其非传统 Decoder-only,而是全新因果 Encoder–Decoder 设计:Encoder 处理输入压缩/分块,Decoder 专注生成;架构改动之大,被评价“本该命名为 DeepSeek V5”。
> 相关链接:Raschka 评论|Stochastic Chasm 架构分析
Agent 与工具链
OpenAI 上线 GPT-Live-1:全双工语音 API,支持边听边说+后台委托推理
OpenAI 将 GPT-Live-1 推入 API,支持实时语音交互(听同时说)、可控语调/节奏/表达力,并可自动委托工具调用或后台模型完成复杂推理。
> 相关链接:OpenAI Devs 公告
OpenAI 推出公共测试版 Agents API:集成 Codex 运行时 + 托管沙箱
OpenAI 新 Agents API 提供统一接口,内置 Codex 运行时、云端代码执行沙箱、文件与产物管理;LiveKit、HeyGen、Telnyx 等已接入,GPT-Live-1 成为语音 Agent 底层默认模型。
> 相关链接:Agents API 公告
Cursor 推出 Projects 功能:持久化项目线程 + 协调器 Agent + 跨设备同步
Cursor IDE 新增 Projects,支持长期存活的项目级会话、协调器 Agent 统一调度、子 Agent 共享内存与产物,并在用户设备与 Agent 计算节点间实时同步状态。
> 相关链接:Cursor 官方发布
Cognition 发布 Devin Voice:基于 GPT-Live + SWE-2,支持语音驱动编码 Agent
Cognition 将 Devin 编码 Agent 与 OpenAI GPT-Live-1 深度集成,推出 Devin Voice;用户可用语音发起复杂编程任务,由 SWE-2 模型执行,GPT-Live 处理语音交互与意图理解。
> 相关链接:Devin Voice 发布
基础设施与硬件
vLLM 新版支持 DeepSeek-V4 MegaMoE + Mooncake Store 可卸载 decode KV
vLLM 更新支持 DeepSeek-V4 共享专家融合为 MegaMoE 架构,并集成 Mooncake Store,允许将 decode 阶段的 KV 缓存卸载至 SSD,显著降低显存压力。
> 相关链接:vLLM 更新说明
Ollama 和 Baseten 日内上线 V4.1 Flash 支持:Ollama 覆盖 Max/Team/Pro 计划
Ollama 当日即向 Max 和 Team 账户推送 V4.1 Flash,后续扩展至 Pro 用户;Baseten 同步上线,定位为‘比 V4 Pro 更聪明、更快、更省’,仅限美国地区、支持 ZDR。
> 相关链接:Ollama 支持公告|Baseten 支持公告
研究与方法
Salesforce 研究:微调弱模型需重写失败轮次,而非整条专家轨迹
训练弱模型模仿强专家完整轨迹反而损害性能(-4~30 分),因规划风格不兼容;正确做法是只重写弱模型自身 rollout 中失败的那一轮,保持模型-运行时匹配。
> 相关链接:Salesforce 论文摘要
Qwen 提出 Elastic Horizon:用 90 分位成功长度动态调整交互步数
Qwen 新方法 Elastic Horizon 实时监控任务成功轨迹长度的 90 分位数,自适应调节最大交互步数,在提升成功率的同时节省最多 25% 的轨迹 token。
> 相关链接:DAIR.AI 总结
Google ToolGrad:先生成工具调用链再构造 prompt,下游工具使用率近 100%
Google 新方法 ToolGrad 在 prompt 构造前,先用模型生成高质量工具调用链作为 ground truth,大幅提升下游工具调用准确率,数据集构建通过率达 99.8%。
> 相关链接:ToolGrad 介绍
产品与应用落地
ChatGPT Work 上线 Data Agent:直连企业数据源,支持仪表盘+问答+自动操作
ChatGPT Work 新增 Data Agent,可接入 Box、Snowflake、Salesforce 等企业数据源,直接生成业务仪表盘、回答自然语言问题,并触发数据更新/导出等动作。
> 相关链接:ChatGPT 官方公告
Box 集成 ChatGPT:将企业文件系统变成 AI 可读的‘受管上下文’
Box 宣布与 ChatGPT Work 深度集成,把企业文档库变成 AI 可访问、可审计、带权限控制的上下文源,用户无需手动上传即可让 Data Agent 直接分析内部文件。
> 相关链接:Box 官方声明
行业与公司动态
Cognition 发布 SWE-2:编码模型达前沿水平,成本低至同类 30%
Cognition 推出 SWE-2 编码模型,称其在主流编程评测上媲美 GPT-6 Astra,但训练与推理成本仅为后者约 30%;团队自研算法、基建与数据,RL 规模达数万亿参数。
> 相关链接:SWE-2 发布
Cognition 收购 Dioxus Labs:强化 Devin VM、计算机使用与测试能力
Cognition 宣布收购 Rust 生态 Dioxus Labs 团队,重点加强 Devin 的虚拟机底层、计算机操作(click/type/run)和自动化测试能力,Dioxus 开源项目继续独立维护。
> 相关链接:收购公告
政策、治理与安全
Anthropic 发布最详尽滥用报告:拦截全部已知 Claude 用于网络攻击/生物/武器等企图
Anthropic 公开详细威胁情报报告,披露多起利用 Claude 进行网络攻击、影响力操纵、生物实验设计、监控与武器开发的尝试,称已成功阻断所有案例。
> 相关链接:Anthropic 报告
Redwood 等呼吁规范‘神经语’风险:削弱思维链可见性的架构需提前公示政策
Redwood Research 与 Ryan Greenblatt 联合倡议:若模型架构会大幅削弱 Chain-of-Thought 可解释性(如 GPT-6 Astra),厂商须在部署前公开证据与治理政策。
> 相关链接:透明度倡议