模型比较
我们持续评测50+款主流大语言模型,提供客观、全面的横向对比数据。
编辑推荐
Anthropic · 2026.7
综合得分
97/100
Anthropic · 2026.7
综合得分
96/100
腾讯 · 2026.7 开源
综合得分
91/100
DeepSeek · 2026.4 开源
综合得分
94/100
详细对比
| 模型 | 开发商 | 类型 | 推理 | 代码 | 创作 | 上下文 | 价格/M tokens | 推荐场景 |
|---|---|---|---|---|---|---|---|---|
|
GPT-5.6 Sol
2026.07
|
OpenAI | 旗舰 | 97 |
96 |
94 |
256K | $3 / $15 | 复杂推理·多智能体·安全研究 |
|
Claude Fable 5
2026.07
|
Anthropic | 旗舰 | 94 |
95 |
97 |
200K | $10 / $50 | 代码·安全合规·创意写作 |
|
GPT-5.6 Terra
2026.07
|
OpenAI | 旗舰 | 93 |
89 |
90 |
128K | $1.25 / $4.25 | 日常办公·Agent·通用对话 |
|
Gemini 3.1 Pro
2026.02
|
旗舰 | 91 |
88 |
87 |
1M | $2 / $12 | 超长文档·视频分析·搜索 | |
|
DeepSeek V4
2026.04
|
DeepSeek | 开源 | 90 |
93 |
86 |
1M | $0.435 / $0.87 | 代码·性价比·私有化 |
|
DeepSeek V4-Flash
2026.04
|
DeepSeek | 开源 | 85 |
87 |
82 |
1M | $0.14 / $0.28 | 高并发·低成本·快速 |
|
混元 Hy3
2026.07
|
腾讯 | 开源 | 86 |
87 |
88 |
256K | ¥1 / ¥4 | Agent·办公·中文写作 |
|
Grok 4.5
2026.07
|
xAI | 旗舰 | 91 |
94 |
84 |
1M | $2 / $6 | 编程智能体·航天工程 |
|
Llama 4 Scout
Meta
|
Meta | 开源 | 84 |
83 |
81 |
128K | 免费/自部署 | 本地部署·多模态 |
|
通义千问 3 Max
阿里云
|
阿里云 | 国产 | 84 |
82 |
88 |
1M | ¥0.4 / ¥1.2 | 中文写作·对话·合规 |
|
文心 4.5 Turbo
百度
|
百度 | 国产 | 81 |
79 |
85 |
128K | ¥0.3 / ¥1.0 | 中文内容·生态丰富 |
|
Mistral Large 3
2026
|
Mistral | 开源 | 86 |
89 |
82 |
128K | $2 / $6 | 欧洲合规·代码 |
* 评分基于听月编辑组综合测试,价格为 API 公开定价(输入/输出),持续更新。
场景推荐
邮件、报告、方案等日常文字工作,性价比优先。
代码生成、Review、Debug,技术精准度优先。
故事、文案、剧本等创意内容,表达质感优先。