性价比
| 模型 | 得分 | 实测任务成本 |
|---|---|---|
| Claude Opus 5.5 · Max, Default Fallback | 58 | US$5.98 |
| gpt-6-astra · Max | 53 | US$3.26 |
| gpt-6.1-sol · Max | 52 | US$0.72 |
| grok-4.7 · Xhigh | 46 | US$3.74 |
| kimi-k3 · Max | 44 | US$2.00 |
| gemini-3.8-flash · High | 41 | US$1.24 |
| deepseek-v4-pro · Max | 36 | US$0.67 |
| 模型 | 得分 | 实测任务成本 |
|---|---|---|
| Claude Opus 5.5 · Max, Default Fallback | 58 | US$5.98 |
| gpt-6-astra · Max | 53 | US$3.26 |
| gpt-6.1-sol · Max | 52 | US$0.72 |
| grok-4.7 · Xhigh | 46 | US$3.74 |
| kimi-k3 · Max | 44 | US$2.00 |
| gemini-3.8-flash · High | 41 | US$1.24 |
| deepseek-v4-pro · Max | 36 | US$0.67 |
在相同评测版本内比较基准测试分数和实测任务费用,同时查看各模型的推理设置。仅凭输入/输出价格无法衡量性能。缺少的测量值会保持未知。
不是。基准测试分数描述的是特定评测。你的任务、延迟、推理设置和总费用都会影响选择。请结合分数与费用列,并打开基准测试来源查看条件。
不是。这表示目录中没有可比较且经核实的测量值。我们不会把分数设为零,也不会根据模型名称或token价格推算分数。缺失值与实测结果分开处理。