跳到正文

#编码

今日 0 条
6月4日周三
  1. Mistral AI60

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项和企业管理工具,基于开源项目 Continue 构建。

    推荐理由:Mistral 把模型、IDE 插件与企业管控打包成一套可私有部署的编码方案,读者可据此判断企业级 AI 编码的落地路径。

5月28日周三
  1. Mistral AI60

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个专为代码设计的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型在检索任务上的对比与维度精度取舍,可据此评估代码 RAG 的存储成本。

5月22日周四
5月21日周三
  1. Mistral AI73

    Mistral AI 发布智能体编码模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SoTA 模型高出 6 个百分点以上。

    推荐理由:Mistral 与 All Hands AI 合作的智能体编码模型,给出 SWE-Bench Verified 成绩与本地部署门槛,便于判断开源编码模型的当前水平。

5月16日周五
  1. OpenAI News62

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明:Codex

    OpenAI 为 o3 和 o4-mini 系统卡发布补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直到通过。

    推荐理由:官方系统卡补充说明披露了 Codex 背后的 codex-1 及其训练方式,可了解该编码智能体的技术来源。

5月7日周三
4月14日周一
  1. OpenAI News78

    OpenAI 在 API 中发布 GPT-4.1 系列模型

    OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并同步推出首个 nano 模型。该系列即日起面向全球开发者开放。

    推荐理由:OpenAI 在 API 中上线 GPT-4.1 系列并首次推出 nano 版本,读者可了解其在编码与长上下文上的改进方向。

3月27日周四
3月20日周四
3月12日周三
2月18日周二
  1. OpenAI News36

    OpenAI 发布 SWE-Lancer 基准

    OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准以真实外包项目为题目来源,衡量模型在实际软件工程工作中的变现能力。

1月13日周一
9月12日周四
8月13日周二
7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。

    推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。

7月16日周二
  1. Mistral AI71

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。

    推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。

6月18日周二
5月29日周三
5月24日周五
  1. Hugging Face Blog45

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。

4月29日周一
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。

4月16日周二
4月9日周二
  1. Hugging Face Blog62

    Google 发布代码专用模型 CodeGemma,含 2B 与 7B 三个版本

    Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。

    推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。

3月15日周五
1月30日周二
10月27日周五
9月11日周一
8月25日周五
  1. Hugging Face Blog82

    Code Llama 发布:Llama 2 学会写代码,Hugging Face 生态同步集成

    Meta 发布 Code Llama,这是基于 Llama 2 初始化、在 5000 亿 token 代码数据上训练的代码模型家族,包含 7B、13B、34B 三个规模,并额外提供 Python 专精版和指令微调版,采用与 Llama 2 相同的社区许可,可商用。

    推荐理由:Hugging Face 生态对 Code Llama 的集成说明,含 7B/13B/34B 各版本基准与部署方式,便于判断选型与落地成本。

8月22日周二
7月3日周一
5月9日周二
  1. Hugging Face Blog62

    用 StarCoder 微调出编程助手 StarChat

    Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder,用 OpenAssistant 对话数据集微调出编程助手 StarChat,并开源了代码、数据集与模型。

    推荐理由:完整给出了从对话提示词到 ChatML 格式、标签掩码与 DeepSpeed ZeRO-3 微调的可复现流程,并附代码与数据集链接。

5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder:15B 参数开源代码大模型

    Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。

    推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。

5月24日周二
3月15日周二