Mistral 发布企业级 AI 编码助手 Mistral Code
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项和企业管理工具,基于开源项目 Continue 构建。
推荐理由:Mistral 把模型、IDE 插件与企业管控打包成一套可私有部署的编码方案,读者可据此判断企业级 AI 编码的落地路径。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项和企业管理工具,基于开源项目 Continue 构建。
推荐理由:Mistral 把模型、IDE 插件与企业管控打包成一套可私有部署的编码方案,读者可据此判断企业级 AI 编码的落地路径。
Mistral AI 发布首个专为代码设计的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索任务上的对比与维度精度取舍,可据此评估代码 RAG 的存储成本。
CodeRabbit 借助 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改造代码审查流程,提升审查准确率并加快 PR 合并速度。该方案帮助开发者更快交付代码,同时减少 bug、提高投资回报率。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SoTA 模型高出 6 个百分点以上。
推荐理由:Mistral 与 All Hands AI 合作的智能体编码模型,给出 SWE-Bench Verified 成绩与本地部署门槛,便于判断开源编码模型的当前水平。
OpenAI 为 o3 和 o4-mini 系统卡发布补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直到通过。
推荐理由:官方系统卡补充说明披露了 Codex 背后的 codex-1 及其训练方式,可了解该编码智能体的技术来源。
OpenAI 发布 Codex。原文正文抓取失败,仅标题可用,暂无更多细节。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业选型的成本与落地条件。
OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并同步推出首个 nano 模型。该系列即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 中上线 GPT-4.1 系列并首次推出 nano 版本,读者可了解其在编码与长上下文上的改进方向。
DeepSeek 本周在 Hugging Face Hub 上线 DeepSeek-V3 0324,架构与初代 DeepSeek-V3 相同,但改用 MIT 许可,重点提升指令遵循、代码与数学能力。
推荐理由:梳理 DeepSeek-V3 0324 的基准提升与 MIT 许可变化,并给出本地部署与安全使用的具体路径。
Hugging Face 博客介绍了如何在本地通过 LM Studio 和 VS Code 的 Continue 扩展运行 OlympicCoder 7B 编程模型,推荐使用 4bit GGUF 量化版本。该模型在 LiveCodeBench 评测中表现优于 Claude 3.7 Sonnet 和 GPT-4o,基于 CodeForces-CoTs 数据集优化,适合处理竞赛类编程难题。
Hugging Face 的 Open R1 项目发布第三期更新,聚焦复现 DeepSeek-R1 配方中的竞赛编程代码推理部分。
推荐理由:Open R1 公开了 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型,并给出五条蒸馏训练经验,可迁移到自己的代码推理训练流程。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准以真实外包项目为题目来源,衡量模型在实际软件工程工作中的变现能力。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的分词器,生成与补全代码速度约为原版 Codestral 的 2 倍,支持 256k 上下文。
推荐理由:Codestral 25.01 的架构与分词器升级带来约 2 倍生成速度,并给出与同量级编码模型的基准对比。
Cognition 联合创始人兼 CEO Scott Wu 解释了 OpenAI o1 如何以更接近人类的方式做出编程决策。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工验证的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。
Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。
推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。
推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。
Paf 在全公司范围采用 ChatGPT Enterprise,工程师每天使用自定义 GPTs 加速日常开发任务。Paf 还将 ChatGPT Enterprise 接入 grit:lab 编程学院,让学员从第一天起就以 AI 增强的系统架构思维学习。目前 Paf 有 70% 的员工活跃使用 ChatGPT Enterprise,覆盖财务、HR、营销和客户支持等业务团队。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均 5.6 个测试用例、分支覆盖率 99%。
Mistral AI 发布首个代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,并通过 fill-in-the-middle 机制补全代码。
推荐理由:Codestral 以 22B 开放权重和 32k 上下文切入代码补全,读者可据此判断它在延迟与长仓库补全上的取舍。
Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐的代码 LLM,训练流程完全透明且宽松许可。
推荐理由:StarCoder2-15B-Instruct 用完全自对齐流程达到 72.6 HumanEval,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。
推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
借助 8bit/4bit 量化与辅助生成(assisted generation),StarCoder-15B 在第四代 Intel Xeon 上实现超过 7 倍的推理加速。其中 Q8-StarCoder 采用 SmoothQuant 静态量化,精度与 BF16 基线持平甚至略有提升,TTFT 与 TPOT 分别提速约 2.19 倍和 2.20 倍。
Hugging Face 发布博客,介绍如何基于自家 GitHub 组织公开仓库代码微调出代码助手 HugCoder,让开发者可参照搭建自己的个人 copilot。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,可迁移到自有代码库搭建补全助手。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言、8192 token 上下文窗口和 fill-in-the-middle。
Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。
推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。
Hugging Face 发布企业级代码助手 SafeCoder,基于 StarCoder 系列代码大模型构建,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。该方案采用 15B 参数模型,支持 8,192 tokens 上下文,可适配 NVIDIA、AMD、Intel 及 AWS Inferentia2、Habana Gaudi 等硬件。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 流式生成 HTML 网页,实现文本到 Web 应用。模型通过 textGenerationStream 逐 token 输出,配合 TailwindCSS 提示词约束生成样式,并给出防止模型幻觉的提示词技巧。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder,用 OpenAssistant 对话数据集微调出编程助手 StarChat,并开源了代码、数据集与模型。
推荐理由:完整给出了从对话提示词到 ChatML 格式、标签掩码与 DeepSpeed ZeRO-3 微调的可复现流程,并附代码与数据集链接。
Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。
推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。
OpenAI Codex 现已通过 OpenAI API 为 70 款不同应用提供支持,覆盖多种使用场景。
OpenAI 发布 GPT-3 和 Codex 的新版本,可在已有文本中编辑或插入内容,而不再只是续写现有文本。
推荐理由:OpenAI 官方说明 GPT-3 与 Codex 新增编辑和插入能力,可了解其从续写扩展到改写已有文本。