Google DeepMind Co-Scientist 加速肝病机制发现
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假说,并已获实验验证。Co-Scientist 还梳理肝生物学与药理学证据,筛选出可供测试的候选联合疗法。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假说,并已获实验验证。Co-Scientist 还梳理肝生物学与药理学证据,筛选出可供测试的候选联合疗法。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,把各自不同的研究工具结合起来探索 ALS。
斯坦福大学医学院 Gary Peltz 团队用 Google DeepMind 的 Co-Scientist 筛选肝纤维化再利用药物,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝疤痕的损伤反应。相关研究已发表于 Advanced Science。
Hugging Face 发布两款基于 ModernBERT 的 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2。
Hugging Face 发布系列文章,分析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。
Google Research 称其开源工具与开放数据集已赋能全球超 25 万名研究者和开发者,涵盖基因组学、神经科学、地球建模等领域。其中 DeepVariant 等工具已支持处理 250 万人的全基因组与外显子组数据,Open Buildings 包含 18 亿栋建筑检测结果,HAI-DEF 下载量超 480 万次。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的实际用法,可据此判断 AI 辅助科研的落地边界。
IBM Granite 团队公开了 Granite 4.1 系列稠密 LLM(3B、8B、30B)的完整训练流程,模型在约 15T token 上从零训练,采用五阶段预训练管线,上下文窗口最终扩展至 512K token。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛屿并在其间异步传输数据,从而隔离局部硬件故障。
推荐理由:Google DeepMind 披露 Decoupled DiLoCo 的异步训练架构,读者可了解跨数据中心训练在带宽与容错上的取舍。
Hugging Face 发布 QIMMA(阿拉伯语"顶峰"),一个先验证基准质量再评测模型的开源阿拉伯语 LLM 排行榜。QIMMA 整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌与编程 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。
Google Research 发布论文《Reasoning-Driven Synthetic Data Generation and Evaluation》。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上把重建误差降低 4.4%,主要来自 merge error 的减少。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量达其 4 倍的模型。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单跟踪、政策问答、捆绑规划和多意图旅程 8 个可验证环境。
Google Research 推出 ConvApparel,一个包含超 4,000 段人机多轮对话(近 15,000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Safetensors 已加入 PyTorch 基金会,成为 Linux 基金会下与 DeepSpeed、Helion、Ray、vLLM 和 PyTorch 并列的托管项目,商标、仓库和治理权归属 Linux 基金会而非任何单一公司。
阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上取得 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
Google Research 发布研究《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,指出 AI 评测常用的每项 1-5 名标注者往往不足,要反映人类意见差异常需每项超过 10 名标注者。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后扩展到 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Hugging Face 发布 TRL v1.0,将其从研究代码库转为带明确稳定性承诺的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。稳定核心遵循语义化版本,覆盖 SFT、DPO、Reward modeling、RLOO 和 GRPO 等训练器;实验层不承诺兼容,新方法先在此落地。从最后一个 0.x 版本迁移改动很小,官方提供了迁移指南。
推荐理由:官方说明 TRL v1.0 的稳定与实验分层设计,读者可据此判断后训练库的选型与迁移成本。
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、房价等指标。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,读者可据此了解中美份额与小型模型的实际使用格局。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并同时支持稠密与 MoE 架构及多模态输入。
推荐理由:原文给出企业用自有数据训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的可行边界。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源 AI 模型,Mistral 提供模型架构、多模态能力和微调工具,NVIDIA 提供算力、模型开发工具与合成数据生成管线。
推荐理由:Mistral 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开放前沿模型的联合训练分工与开源计划。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 中驱动输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google 宣布在 Flood Hub 上线城市山洪(flash flood)预报,借助新的 AI 方法可提前最多 24 小时预测城市区域的山洪风险。
推荐理由:Google 把洪水预报从河流扩展到城市内涝,并给出与 NWS 同口径的精度对比,可据此判断全球预警覆盖的差距。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中抽取结构化灾害事件数据,首个开放数据集收录 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其人工核验准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Hugging Face 调研了 16 个围绕异步训练构建的开源 RL 库,并按编排原语、缓冲区设计、权重同步协议、staleness 管理、部分 rollout 处理、LoRA 支持、分布式训练后端 7 个维度进行对比。
Hugging Face Hub 推出 Storage Buckets,一种面向生产 ML 中间产物的可变、类 S3 对象存储,可在 Hub 浏览、用 Python 脚本操作或通过 hf CLI 管理。
推荐理由:官方给出 Buckets 的定位与 Xet 去重、预热的取舍,可据此判断它是否适合替代现有中间产物存储流程。
Google DeepMind 发文回顾 AlphaGo 击败围棋世界冠军十周年,称其标志着现代 AI 时代的开端。此后该技术路线催生了 AlphaFold 2,预测出科学界已知的 2 亿个蛋白质结构并开源,2024 年 Demis Hassabis 与 John Jumper 因此获诺贝尔化学奖。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
LeRobot v0.5.0 发布,自 v0.4.0 以来合并 200 多个 PR、新增 50 多位贡献者,首次加入 Unitree G1 人形机器人支持,覆盖行走、操作、遥操作与全身控制。
推荐理由:从硬件、策略到数据管线逐项列出变化,可据此判断开源机器人栈当前覆盖到哪一步。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。
推荐理由:Google Research 联合非洲高校发布 27 种语言的开放语音数据集,可了解低资源语音数据的采集方法与许可条件。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手的预测,从而学会概率推理。在五轮模拟航班推荐任务中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升了该任务表现,还能泛化到其他任务。
Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成文本到图像扩散模型训练,并开源训练代码与实验框架。该方案采用 x-prediction 在像素空间直接训练、无需 VAE,并叠加 LPIPS 与 DINOv2 感知损失、TREAD token 路由、REPA 表征对齐和 Muon 优化器。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出从安装 Skill 到提交 HF Jobs 的完整命令与成本表,可据此估算小模型微调的实际开销。
Google Research 提出 MapTrace,一套可扩展的合成数据生成流程,用于训练多模态大模型在地图上追踪路径,并开源了基于 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万问答对。