模型与能力
Ornith-1.5 开源:9B 到 397B 多规格 MIT 模型,主打端到端自改进
Ornith 发布 Ornith-1.5 系列(9B 密集/35B MoE/397B MoE),MIT 协议,支持 FP8/GGUF/MLX/NVFP4 量化;在 Terminal-Bench 2.1(86.1)、SWE-Bench Verified(86)等编码/智能体评测中表现突出,已接入 vLLM 和 Ollama。
> 相关链接:发布推文
GLM-5.3 能力跃升靠 RL,不是堆参数
智谱 GLM-5.3 与 GLM-5.2 架构相同,仅靠约 1 个月强化学习(RL)大幅提升:Terminal Bench 第 2、Legal Bench 第 3、Skills Bench 第 6;核心是长周期真实工程环境训练(如诊断训练瓶颈、跑实验、交付加速)。
> 相关链接:技术说明|评测排名
Qwen3.8-27B 动态量化 V3:10% 更准,1-bit 仍保 77% BF16 准确率
Unsloth 推出 Qwen3.8-27B Dynamic V3 GGUF 量化版本,在同等大小下比竞品高约 10% 准确率;最低支持 1-bit 量化,可在 8GB RAM 运行,且保留约 77% 的 BF16 级准确率。
> 相关链接:Reddit 技术帖|Hugging Face 发布页
Agent 与工具链
DeepSeek Harness(DSH):所有功能都是插件,连 agent 循环本身也是
DeepSeek 公开的 DSH 不是完整产品,而是轻量级插件运行时(Cordis 架构);用户一周内就开发超 100 个插件,包括围棋测试床、直连数据库执行 SQL 的 agent,强调可扩展控制流和业务规则注入。
> 相关链接:知乎前沿解读
TrueForge 开源:企业级 agent harness,用 GLM-5.2 降本 75%
TrueFoundry 开源 TrueForge(MIT 协议),支持工具编排、子 agent、代码沙箱、人工审批;在 14 任务企业基准上,用 GLM-5.2 替代 Claude Opus 4.8,成本降约 75%,准确率不掉。
> 相关链接:官方发布
Microsoft Agent Lightning:把任意 harness 接入 RL 训练,6K 样本提升 SWE-Bench 14.6%
微软开源 Agent Lightning v1.0,通过代理层将任意 agent harness(如 DSH、TrueForge)对接 RL;用约 6K 样本训练 Qwen3.5-9B,SWE-Bench Verified 从 41.8% 提升至 56.4%。
> 相关链接:技术介绍
基础设施与硬件
Qdrant 推出可过滤 HNSW:1% 过滤召回率 99.8%,比 ACORN 快 4.7 倍
Qdrant 新版 HNSW 在索引层直接建模 payload 过滤(如标签/权限),在 1% 过滤率下实现 99.8% 召回率 & 1.0ms 延迟;ACORN 同场景仅 67.7% 召回 & 4.7ms,但 ACORN 更适合多条件 AND 过滤。
> 相关链接:Qdrant 官方说明
Linear 用 Turbopuffer 替换 Postgres:Delta 同步快了约 8 秒
项目管理工具 Linear 将 delta sync 读路径从 Postgres 迁移到向量数据库 Turbopuffer,利用属性索引做权限过滤,最大同步耗时减少约 8 秒。
> 相关链接:Turbopuffer 宣布
研究与方法
参数数量过时了:唐杰教授提出五大缩放维度(含 XA-YB MoE 表示法)
唐杰指出,参数量只在结合数据量、计算分配方式、运行条件三者时才有意义;提出 5 大缩放维度,包括 MoE 稀疏度(新记号 XA-YB),并强调长因果链推理(20+ 步)不依赖总参数,而依赖训练质量。
> 相关链接:X 平台声明|MoE 新记号说明
Sentence Transformers v6.0:从单向量检索转向多向量检索
新版 Sentence Transformers 支持 multi-vector 检索——不再把整段文本压缩成一个向量,而是保留 token 级向量,让 query tokens 与 doc tokens 逐对匹配再聚合,更适合高质量搜索。
> 相关链接:作者总结
产品与应用落地
Gemini 3.7 Flash:AI Mode 实时生成交互式模拟,表格任务成本 $0.54/个
Gemini 3.7 Flash 在 AI Mode 中支持边聊边生成交互式模拟(如动态图表/文档分析),在 Artificial Analysis 的 80 个表格密集任务中以 $0.54/个成本拿下第一,响应仅 1.32 秒/任务。
> 相关链接:评测结果|产品集成
OpenAI 推出 Private Safety Processing:前沿模型零数据留存 + 跨对话安全检测
OpenAI 新增隐私安全模块,确保使用 GPT-5.6 Luna 等前沿模型时仍满足 Zero Data Retention,同时无需人工查看内容即可检测跨轮次安全风险(如越狱、诱导)。
> 相关链接:官方公告
Claude Code 新增 Concise 模式:输出更短、更聚焦,开发者反馈明显
Anthropic 为 Claude Code 编程助手新增「Concise」输出风格,自动压缩冗余解释、聚焦关键代码和步骤,被广泛认为是提升日常编码效率的小而实的 UX 改进。
> 相关链接:开发者公告
行业与公司动态
OpenRouter 被 Stripe 收购:API 路由市场成核心基础设施
OpenRouter 宣布加入 Stripe,业界普遍解读为:模型 API 路由、计费、监控等中间层服务已从边缘工具升级为云时代必备基础设施。
> 相关链接:创始人确认
政策、治理与安全
Anthropic 开源 Petri:首个面向对齐风险的可审计评测工具
Anthropic 开源 Petri 工具,用于系统性评估模型是否出现迎合、欺骗等对齐风险,并支持外部第三方独立审计,降低红队门槛。
> 相关链接:Twitter 发布