模型能力-成本边界

成本口径
成本范围
模型 pass@1 与单任务成本散点图 模型思考强度点由轨迹连接,深色折线表示成本与能力的 Pareto 前沿。

多来源能力比较

按同一能力类别展示 BenchLM.ai、DeepSWE、CodexRadar 与 Artificial Analysis 的原始分数。不同基准的任务集和评分口径不同,仅用于观察来源内相对位置。

多来源模型能力分数比较 同一模型在不同 benchmark 来源中的原始能力分数。

当前范围

模型强度 pass@1平均成本 边界数据源