跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–1 条 · 共 1 条
10月1日周四
  1. BestBlogs.dev80

    谷歌发布 Gemini 4 Argon:多项基准登顶,首批仅限审核团队

    谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1(77.9%)、CWE-bench v1(68%)、Vals Index(68.90%)和 Text Arena(1525 分)等评测中领跑,但在 Code Arena 仅排第八。

    推荐理由:汇总了 Gemini 4 Argon 的多项基准成绩、定价与首批开放范围,并附上内部员工对跑分与实际编程表现的争议。