跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

110条精选相关主题论文研究部署工程模型发布

最新精选

第 41–60 条 · 共 110 条
12月1日周一
11月25日周二
  1. Google DeepMind62

    AlphaFold 助力解析心脏病关键蛋白 apoB100 结构

    Google DeepMind 介绍一项由 AlphaFold 参与的研究,科学家解析了“坏胆固醇”关键蛋白 apoB100 的结构。密苏里大学研究者先用冷冻电镜拍摄 LDL 颗粒图像,再由物理学家用 AlphaFold 生成原子级结构预测并与电镜数据比对,最终得到笼状外壳和带状结构的模型。该结构有望帮助更精准地预防、诊断和治疗高胆固醇与动脉粥样硬化性心血管疾病。

    推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体用法。

11月21日周五
11月3日周一
10月29日周三
  1. Hugging Face Blog62

    Hugging Face 长文分析全球算力格局如何向中国倾斜

    Hugging Face 发布长文分析全球 AI 算力格局的变化,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。

    推荐理由:梳理美国出口管制与中国国产芯片、开源模型之间的因果链,并给出从硬件到软件栈的替代进展时间线。

10月27日周一
  1. Hugging Face Blog62

    Hugging Face 改进 datasets 流式加载,请求数减少 100 倍

    Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 接口保持不变,启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多提升 2 倍。

    推荐理由:官方给出流式加载的请求数、解析时间和吞吐变化,读者可据此判断大规模训练的数据管线是否值得切换。

10月1日周三
8月21日周四
  1. Hugging Face Blog60

    NVIDIA 发布 600 万多语言推理数据集 Nemotron Post-Training Dataset V2

    NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万多语言推理样本。

    推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与筛选比例,读者可据此了解后训练数据的翻译与幻觉控制方法。

8月8日周五
  1. Hugging Face Blog62

    Hugging Face 发布 AI Sheets:用开放 AI 模型处理数据集的无代码工具

    Hugging Face 发布开源无代码工具 AI Sheets,可在表格界面中通过提示词构建、转换和丰富数据集,支持调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss)或本地模型。

    推荐理由:Hugging Face 官方开源的无代码数据集工具,读者可了解如何用开放模型批量构建、标注和评测数据。

8月7日周四
  1. Hugging Face Blog60

    TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

    Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

    推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。

7月8日周二
6月11日周三
  1. Mistral AI62

    Mistral AI 推出 Mistral Compute AI 基础设施服务

    Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 与服务的私有集成栈,形态从裸金属服务器到全托管 PaaS。该服务将搭载 NVIDIA 参考架构,可提供数万块 GPU,并包含用于区域和行业特定 AI 的训练套件。Mistral 称其面向欧洲、中东、亚洲及南半球等寻求美国或中国云厂商替代方案的机构,强调数据主权与脱碳能源。

    推荐理由:Mistral 从模型厂商延伸到自有 AI 基础设施,读者可据此判断欧洲主权算力供给的另一种路径。

6月3日周二
5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值量化语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。

3月12日周三
3月11日周二
  1. Hugging Face Blog70

    Hugging Face 与 Yaak 发布 L2D:全球最大开源自动驾驶数据集

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D(Learning to Drive),称其为全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 座城市的 60 辆驾校车辆。

    推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并直接接入 LeRobot 训练管线。

1月21日周二
  1. OpenAI News62

    OpenAI 就 Stargate 基础设施征集数据中心合作方

    OpenAI 发布 Stargate Infrastructure 表单,面向数据中心基础设施领域征集合作企业,覆盖电力、土地、建设到设备等环节。OpenAI 表示将与战略伙伴共同推进 AGI 基础设施建设,并希望与工业基础各环节公司建立合作。

    推荐理由:OpenAI 公开征集数据中心基础设施合作方,可了解其 AGI 基建布局覆盖的环节。

1月15日周三
12月24日周二