LLM Value Index · 甲维斯机出品

大模型性价比推荐榜

数据源 Artificial Analysis 智能指数 v— 数据日期 入围 个模型
榜单 RANKING
#模型智能指数单任务成本 输入/输出 $·1M性价比分
大模型斩杀线 KILL LINE

横轴为单任务成本(对数刻度,越左越便宜),纵轴为智能指数。金线为帕累托前沿,线上的模型没有任何对手能同时做到「更聪明且更便宜」。粉色区域是斩杀区,落在里面的模型,比斩杀线上那个点又贵又笨。

规则与口径 METHODOLOGY
01

性价比分怎么算

性价比分 = 智能指数 ÷ 单任务成本(美元)。比如智能指数 50.1、单任务成本 $0.033,性价比分就是 50.1 ÷ 0.033 ≈ 1527。

02

智能分怎么来

取 Artificial Analysis 智能指数,由 GPQA Diamond、Terminal-Bench、SciCode、Humanity's Last Exam 等十项基准加权合成,业界通用的「综合智商」口径。

03

成本怎么算

单任务成本是模型完成一个标准测试任务实际消耗的费用,按官方 API 价格计算,推理消耗的 token 一并计入。输出越啰嗦,成本越高。

04

为什么设 50 分门槛

智能指数低于 50 的模型再便宜也不参与排名,能用是性价比的前提。门槛线大约是当前旗舰水平的八成。

05

档位怎么取

同一模型的不同推理力度(low / high / max…)视为不同商品,在够到门槛的档位里取性价比最高的一档上榜,档位名标注在模型名旁。