OpenAI 推出 GPT-5.6 模型家族:旗舰 Sol 复杂推理登顶、均衡 Terra 成本降至 2x、轻量 Luna 日常最优。Sol Pro 模式可协调多智能体并行,Agents' Last Exam 成本仅为 Fable 5 的 1/4。Codex App 并入 ChatGPT 桌面端
Anthropic 首次证明可观测 Claude 内部思维——发现与人类大脑高度相似的"全局工作空间" J-space,仅一小部分内部信息能像人类有意识想法一样被调取思考。Jacobian lens 可审计模型真实推理过程
xAI 发布 Grok 4.5,1.5 万亿参数主打编程智能体,针对航天工程代码与大型软件项目深度优化。百万级代码库长上下文读取、跨文件自主调试,配套 Cursor 编程工具
腾讯混元 Hy3 正式发布,295B 总参数/21B 活跃参数 MoE 快慢思考融合架构,盲测优于 GLM 5.1。WorkBuddy 任务成功率 72%升至90%,Apache 2.0 开源,定价 ¥1/¥4 per M tokens
OpenAI 推出 GPT-Live 全双工语音模型,同步听录、同步输出架构,用户可随时打断 AI 发言。后台联动 GPT-5.5 深度推理,前台持续维持流畅度,免费用户可用 mini 版
美团开源 LongCat-2.0,1.6 万亿参数 MoE 架构,原生 1M 上下文。五万卡国产算力集群全流程训练,SWE-bench Pro 59.5% 领先 Gemini 3.1 Pro
DeepSeek V4 以 MIT 协议开源,Pro 版 1.6T 总参数/49B 活跃参数,Flash 版 284B/13B。CSA+HCA 混合注意力让 1M 上下文 KV Cache 仅为 V3.2 的 10%,API 定价低到极致……
Anthropic 发布 Claude 4.6 Opus,200K 上下文 + Constitutional AI 安全对齐,在复杂代码生成、长链推理和金融医疗合规场景持续领先……
OpenAI 发布 GPT-5.4,支持深度推理与快速响应双模式,原生多模态覆盖文本/图像/音频,工具调用生态成熟。定价 $2.50/$15 per M tokens……
Google 发布 Gemini 3.1 Pro,1M 超长上下文与原生视频理解成为最大亮点,SWE-bench 80.6% 追平开源模型,与 Workspace/Cloud 深度集成……
从 Llama 2 到 DeepSeek V4,开源与闭源模型在 SWE-bench 上的差距从 20% 缩小到 <1%。成本下降 97% 正在重塑企业 AI 选型逻辑……
DeepSeek V4 专家模式、GPT-5.4 工具调用、Claude 4.6 Extended Thinking 共同推动 Agent 能力爆发。从自动改代码到端到端任务执行……
DeepSeek V4 以 MIT 开源,GPQA Diamond 90.1% 领先同行。开源、成本、自主算力三条战线同时突破,中国 AI 首次进入领跑者行列……
欧盟 AI 法案进入深度执行阶段,高风险 AI 系统需要完整审计链。企业如何在 Claude 4.6 的 Constitutional AI 与 Gemini 的 Grounding 之间做合规选择……