Open R1 更新第三期:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型
Hugging Face 的 Open R1 项目发布第三期更新,聚焦复现 DeepSeek-R1 配方中的竞赛编程代码推理部分。
推荐理由:Open R1 公开了 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型,并给出五条蒸馏训练经验,可迁移到自己的代码推理训练流程。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Hugging Face 的 Open R1 项目发布第三期更新,聚焦复现 DeepSeek-R1 配方中的竞赛编程代码推理部分。
推荐理由:Open R1 公开了 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型,并给出五条蒸馏训练经验,可迁移到自己的代码推理训练流程。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的分词器,生成与补全代码速度约为原版 Codestral 的 2 倍,支持 256k 上下文。
推荐理由:Codestral 25.01 的架构与分词器升级带来约 2 倍生成速度,并给出与同量级编码模型的基准对比。
Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。
推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。
推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。
Mistral AI 发布首个代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,并通过 fill-in-the-middle 机制补全代码。
推荐理由:Codestral 以 22B 开放权重和 32k 上下文切入代码补全,读者可据此判断它在延迟与长仓库补全上的取舍。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐的代码 LLM,训练流程完全透明且宽松许可。
推荐理由:StarCoder2-15B-Instruct 用完全自对齐流程达到 72.6 HumanEval,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。
Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。
推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。
Hugging Face 发布博客,介绍如何基于自家 GitHub 组织公开仓库代码微调出代码助手 HugCoder,让开发者可参照搭建自己的个人 copilot。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,可迁移到自有代码库搭建补全助手。
Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。
推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder,用 OpenAssistant 对话数据集微调出编程助手 StarChat,并开源了代码、数据集与模型。
推荐理由:完整给出了从对话提示词到 ChatML 格式、标签掩码与 DeepSpeed ZeRO-3 微调的可复现流程,并附代码与数据集链接。
Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。
推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。
OpenAI 发布 GPT-3 和 Codex 的新版本,可在已有文本中编辑或插入内容,而不再只是续写现有文本。
推荐理由:OpenAI 官方说明 GPT-3 与 Codex 新增编辑和插入能力,可了解其从续写扩展到改写已有文本。