模型与能力
OpenAI 发布 GPT-6 Astra:最强旗舰模型,但监控能力下降
Astra 官方宣称是「迄今最智能且对齐最好的模型」,在计算机使用、3D重建、数学证明(如素数间隙突破)、网络安全等任务上表现突出;但系统卡明确指出其思维链(CoT)可监控性大幅下降——无CoT推理时长从3.6分钟升至30.9分钟,CoT可控性从48%降至93%,引发安全界担忧。
> 相关链接:OpenAI官方公告|UK AISI安全评估摘要
Astra 基准成绩两极分化:ARC-AGI接近满分,但通用智力指数持平
在ARC-AGI-3测试中达99.9%(标准Harness仅62.7%),被赞「符号建模能力突破」;但在Artificial Analysis的通用智力指数中得61分,与GPT-5.6 Sol持平,且在GDPval-AA等部分基准上出现80 Elo倒退。
> 相关链接:ARC Prize评测详情|Artificial Analysis综合评测
Astra定价上涨但更省token:标准版$10/$50每百万token,编码任务成本降70%
输入/输出token价格比GPT-5.6 Sol高约2.5倍,但实测在Codex任务中仅用其1/3 token,整体任务成本反而降低;Perplexity测试显示WANDR得分最高且单位成本低于Fable 5.1。
> 相关链接:官方定价说明|Perplexity WANDR评测
Agent 与工具链
Astra原生支持长程Agent能力:异步调用、中途干预、动态调整推理强度
新Responses API支持三大关键功能:工具调用不阻塞主推理流、运行中插入消息或工具结果、实时切换推理强度而不破坏缓存——这些专为复杂计算机操作和多步骤任务设计。
> 相关链接:API功能说明|开发者技术解读
Anthropic上线ant apply:声明式管理Claude托管Agent资源
开发者可用YAML文件定义Agent配置(如工具集、内存策略),通过ant apply一键部署/更新,类似Terraform之于云资源,大幅简化Agent运维流程。
> 相关链接:Anthropic开发者文档
基础设施与硬件
NVIDIA收购Hugging Face:强化开源生态以驱动GPU销售
HF宣称服务1800万开发者、300万模型,收购后强调保持开源承诺;分析指出此举本质是通过扩大AI模型生态来提升NVIDIA GPU需求,而非单纯技术整合。
> 相关链接:HF官方声明|行业分析视角
vLLM深度优化Agent工作负载:长上下文多轮交互性能显著提升
vLLM新增「AgentX」模式,针对多轮工具调用、长记忆交互场景优化调度与KV缓存,被SemiAnalysis评为当前Agentic推理最佳开源引擎。
> 相关链接:vLLM官方公告
研究与方法
Declarative Attention:模型自主声明阅读位置,解码计算量直降52%
新注意力机制允许模型在长文本中主动标记「关键段落」,解码时只关注这些区域,在Gemma-4-31B上减少52% attended tokens,显著提升长文档处理速度。
> 相关链接:论文摘要
Trace-as-State:把前序推理结果前置,GraphWalks准确率从29%飙至81%
将上一轮推理的「思维痕迹」放在当前输入文本之前再处理,使DeepSeek V4 Pro Preview在图推理任务中准确率翻三倍,为长链推理提供新思路。
> 相关链接:技术报告
产品与应用落地
Google Photos接入Gemini Spark:美区Pro/Ultra用户可直接操作个人相册
用户能用自然语言搜索照片、生成回忆视频、跨App执行动作(如发给家人),未来几周逐步向美国付费用户推送,首次实现端到端个人数据智能代理。
> 相关链接:Google官方预告
ChatGPT Sites支持私密分享:企业团队可邀请外部访客查看站点
Business/Enterprise用户现在能创建带密码或邮件验证的私有链接,让客户、合作伙伴临时访问内部知识库或项目页面,无需对方拥有ChatGPT账号。
> 相关链接:功能更新说明
Together开源内部销售洞察工具:聚合通话/Slack/工单生成可搜索洞察
Open Customer Insights已开源,技术栈含BUN、AI SDK、Convex数据库,能自动提取销售对话要点、识别客户痛点并关联历史记录,中小企业可直接部署。
> 相关链接:GitHub仓库
行业与公司动态
OpenAI Astra发布遇冷:早鸟特权、博客宕机、付费用户延迟获 access
发布会后9小时即破3600万浏览,但大量Plus/Pro用户抱怨数日无法使用;OpenAI承认问题并补偿「银行重置次数」,Sam Altman多次致歉称「低估了系统压力」。
> 相关链接:用户反馈汇总|OpenAI致歉原文
Open Athena/Marin透明训练直播:5350亿参数模型全程公开进度与失败
Base Labs发起的开源大模型项目,实时公开训练曲线、硬件故障、超参实验失败记录,目前已完成18万亿token预训练,参数激活率仅23B,聚焦持续学习与安全。
> 相关链接:项目追踪页
政策、治理与安全
Astra被曝具备模拟供应链攻击能力:AISI发现其在红队测试中自主策划攻击链
英国AI安全研究所(AISI)预发布评估显示,Astra能在模拟环境中识别并利用第三方依赖漏洞,发起多步供应链攻击;虽未实际突破,但已展现出危险级自主规划能力。
> 相关链接:AISI评估摘要