跳到正文

#数据/训练

今日 5 条
11月25日周二
  1. Google DeepMind62

    AlphaFold 助力解析心脏病关键蛋白 apoB100 结构

    Google DeepMind 介绍一项由 AlphaFold 参与的研究,科学家解析了“坏胆固醇”关键蛋白 apoB100 的结构。密苏里大学研究者先用冷冻电镜拍摄 LDL 颗粒图像,再由物理学家用 AlphaFold 生成原子级结构预测并与电镜数据比对,最终得到笼状外壳和带状结构的模型。该结构有望帮助更精准地预防、诊断和治疗高胆固醇与动脉粥样硬化性心血管疾病。

    推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体用法。

11月22日周六
  1. Google Research22

    Google 用简单线性回归模型预测电动车充电桩可用性,缓解续航焦虑

    Google 设计了一个轻量级线性回归模型,预测某充电站在未来若干分钟后充电端口可用的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。模型仅以一天中各小时作为特征,在 30 至 60 分钟预测区间、100 个随机站点上评估,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。

11月21日周五
11月17日周一
11月14日周五
11月12日周三
11月11日周二
11月8日周六
11月7日周五
11月5日周三
  1. Google Research41

    Google 发布 ForestCast:用深度学习预测森林砍伐风险

    Google 发布 ForestCast,用纯卫星数据训练的深度学习模型预测森林砍伐风险,并公开首个相关基准数据集。模型基于 vision transformers,仅用 Landsat 和 Sentinel 2 卫星数据及"变化历史"输入,精度可匹配或超过依赖道路等专用地图的传统方法。研究显示"变化历史"是最关键输入,单独使用即可达到与全量原始卫星数据相当的精度。

11月3日周一
10月31日周五
10月30日周四
  1. Hugging Face Blog42

    MiniMax M2 如何重新思考智能体的泛化能力

    MiniMax M2 在 post-training 的智能体对齐阶段提出,智能体泛化不只是适配新工具,而是要在工具信息、系统提示词、用户提示词、环境和工具返回等全流程扰动下保持稳定。团队因此采用 Interleaved Thinking,让思考过程贯穿任务全程而非仅在开头,并构建了面向全轨迹泛化的数据管线。M2 用户需保留包含思考步骤的完整会话历史,否则会出现性能差距。

10月29日周三
  1. Hugging Face Blog62

    Hugging Face 长文分析全球算力格局如何向中国倾斜

    Hugging Face 发布长文分析全球 AI 算力格局的变化,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。

    推荐理由:梳理美国出口管制与中国国产芯片、开源模型之间的因果链,并给出从硬件到软件栈的替代进展时间线。

10月27日周一
  1. Hugging Face Blog62

    Hugging Face 改进 datasets 流式加载,请求数减少 100 倍

    Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 接口保持不变,启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多提升 2 倍。

    推荐理由:官方给出流式加载的请求数、解析时间和吞吐变化,读者可据此判断大规模训练的数据管线是否值得切换。

10月17日周五
10月14日周二
10月1日周三
9月26日周五
9月22日周一
9月16日周二
9月12日周五
9月10日周三
9月9日周二
9月3日周三
9月1日周一
  1. Berkeley AI Research24

    word2vec 究竟学到了什么?伯克利提出可定量预测的学习理论

    伯克利 AI 研究团队证明,在若干温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,其梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率 P(i,j) 与一元概率 P(i) 定义,从小初始化训练时模型按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。

8月22日周五
8月21日周四
  1. Hugging Face Blog60

    NVIDIA 发布 600 万多语言推理数据集 Nemotron Post-Training Dataset V2

    NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万多语言推理样本。

    推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与筛选比例,读者可据此了解后训练数据的翻译与幻觉控制方法。

8月14日周四
8月12日周二
8月8日周五
  1. Hugging Face Blog62

    Hugging Face 发布 AI Sheets:用开放 AI 模型处理数据集的无代码工具

    Hugging Face 发布开源无代码工具 AI Sheets,可在表格界面中通过提示词构建、转换和丰富数据集,支持调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss)或本地模型。

    推荐理由:Hugging Face 官方开源的无代码数据集工具,读者可了解如何用开放模型批量构建、标注和评测数据。

8月7日周四
  1. Hugging Face Blog60

    TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

    Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

    推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。

8月1日周五
7月29日周二
7月25日周五
7月23日周三
7月18日周五