谷歌发布 Gemini 4 Argon:多项基准登顶,首批仅限审核团队
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1(77.9%)、CWE-bench v1(68%)、Vals Index(68.90%)和 Text Arena(1525 分)等评测中领跑,但在 Code Arena 仅排第八。
推荐理由:汇总了 Gemini 4 Argon 的多项基准成绩、定价与首批开放范围,并附上内部员工对跑分与实际编程表现的争议。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1(77.9%)、CWE-bench v1(68%)、Vals Index(68.90%)和 Text Arena(1525 分)等评测中领跑,但在 Code Arena 仅排第八。
推荐理由:汇总了 Gemini 4 Argon 的多项基准成绩、定价与首批开放范围,并附上内部员工对跑分与实际编程表现的争议。
DharmaOCR 在葡萄牙语专用基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
OpenAI 公开了其 AI 模型针对 First Proof 数学挑战的证明尝试,用于测试模型在专家级问题上的研究级推理能力。该挑战聚焦研究级数学推理,OpenAI 未披露具体模型名称与成绩。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可重跑评测流程并独立核验结果。
Numina 与 Kimi 团队发布定理证明模型 Kimina-Prover-72B,基于 Qwen2.5-72B 和 Kimi k1.5 的 RL 流程训练,在 miniF2F 基准上取得 92.2% 的 SOTA 通过率。