AI 模型全面评测

我们持续评测50+款主流大语言模型,提供客观、全面的横向对比数据。

✦ 综合最强
💎

GPT-5.6 Sol

Anthropic · 2026.7

推理
97
代码
96
多模态
94
工具
96

综合得分

97/100

🧠

Claude Fable 5

Anthropic · 2026.7

推理
94
代码
95
创作
97
安全
99

综合得分

96/100

💰 性价比冠军
🚀

混元 Hy3

腾讯 · 2026.7 开源

推理
86
代码
87
长上下文
91
性价比
99

综合得分

91/100

DeepSeek V4

DeepSeek · 2026.4 开源

推理
90
代码
93
长上下文
95
性价比
97

综合得分

94/100

完整模型对比表

模型 开发商 类型 推理 代码 创作 上下文 价格/M tokens 推荐场景
💎
GPT-5.6 Sol
2026.07
OpenAI 旗舰
97
96
94
256K $3 / $15 复杂推理·多智能体·安全研究
🧠
Claude Fable 5
2026.07
Anthropic 旗舰
94
95
97
200K $10 / $50 代码·安全合规·创意写作
🌍
GPT-5.6 Terra
2026.07
OpenAI 旗舰
93
89
90
128K $1.25 / $4.25 日常办公·Agent·通用对话
🌟
Gemini 3.1 Pro
2026.02
Google 旗舰
91
88
87
1M $2 / $12 超长文档·视频分析·搜索
🚀
DeepSeek V4
2026.04
DeepSeek 开源
90
93
86
1M $0.435 / $0.87 代码·性价比·私有化
DeepSeek V4-Flash
2026.04
DeepSeek 开源
85
87
82
1M $0.14 / $0.28 高并发·低成本·快速
🐉
混元 Hy3
2026.07
腾讯 开源
86
87
88
256K ¥1 / ¥4 Agent·办公·中文写作
🚀
Grok 4.5
2026.07
xAI 旗舰
91
94
84
1M $2 / $6 编程智能体·航天工程
🦙
Llama 4 Scout
Meta
Meta 开源
84
83
81
128K 免费/自部署 本地部署·多模态
🐉
通义千问 3 Max
阿里云
阿里云 国产
84
82
88
1M ¥0.4 / ¥1.2 中文写作·对话·合规
🌸
文心 4.5 Turbo
百度
百度 国产
81
79
85
128K ¥0.3 / ¥1.0 中文内容·生态丰富
🌬️
Mistral Large 3
2026
Mistral 开源
86
89
82
128K $2 / $6 欧洲合规·代码

* 评分基于听月编辑组综合测试,价格为 API 公开定价(输入/输出),持续更新。

按需求选择最适合的模型

💼

日常办公写作

邮件、报告、方案等日常文字工作,性价比优先。

🥇 混元 Hy3¥ 超低价
🥈 GPT-5.6 Terra均衡
🥉 DeepSeek V4-Flash快速
💻

代码开发调试

代码生成、Review、Debug,技术精准度优先。

🥇 GPT-5.6 Sol最强
🥈 Claude Fable 5安全
🥉 Grok 4.5编程
🎨

创意写作创作

故事、文案、剧本等创意内容,表达质感优先。

🥇 Claude Fable 5最佳
🥈 GPT-5.6 Sol多模态
🥉 通义千问 3中文