你的智能体到底需要多少记忆?ALTK-Evolve 在八款模型上的剂量实验
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 的智能体记忆剂量研究,在 AppWorld 的 585 个多步任务上测试八款模型,发现记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型横评给出智能体记忆的三种剂量模式,并附上 token 开销对比,可据此判断自家模型该给多少记忆。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 的智能体记忆剂量研究,在 AppWorld 的 585 个多步任务上测试八款模型,发现记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型横评给出智能体记忆的三种剂量模式,并附上 token 开销对比,可据此判断自家模型该给多少记忆。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 上的下载、点赞与衍生模型数据。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用平台下载、点赞与衍生模型数据,给出开源模型生态在规模、许可与采用上的半年变化。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了一条流式数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体(Nano 128 维 1.4M 参数、Tiny 192 维 6.2M 参数、Base 768 维 89M 参数)、分辨率及影像源,输出 int8 格式的 Cloud-Optimized GeoTIFF。
Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。
微软研究院推出 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。该模型支持报告生成、病灶有无与否定判断、异常定位、多标签分类及导管位置检测等任务,采用生成或双推理模式。另一项独立实验中,Qwen3-VL-4B-Instruct 搭配确定性测量工具,用于评估直接计算能否改善测量依赖型病症的表现。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,但前者按任务检索少量高支持度 guideline,而非每步注入完整 playbook。
Hugging Face 论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB,超过单张 H200 的 141GB,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码一致性表现。
Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能本身。GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因利用率差异而拉开差距。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让它们保持忙碌。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云额度,支持 Genesis Mission 的研究人员。
DharmaOCR 在葡萄牙语专用基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家与生物安全专家用 AI 构建更具韧性的社会。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 NVIDIA A100-SXM4-80GB 对 attention 做 profile 分析。文章对比朴素 attention 与 in-place 版本,发现把 masked_fill 换成 masked_fill_ 后,每次前向传播可省去一个 Memcpy kernel。
Google Research 联合 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据训练通用生理表征,读者可了解其自监督缺失感知设计与跨任务泛化表现。
UC Berkeley 团队提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统面临三大新挑战。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL、改为训练时实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练约多花 1 天)。
加州大学伯克利分校 BAIR 实验室展示 2026 届博士毕业生,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。
Google Research 将建筑级屋顶反射率(albedo)数据集从 2024 年试点的 14 座城市扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。
Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比表现。
OpenAI 发布 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研中表现的新基准。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个 Transformer 模型可在单次前向传播中同时估计数据分布的密度与 score,无需针对新分布重新训练。
NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%,且只需改动一行 import。
推荐理由:原文给出同一 from_pretrained() 接口下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Hugging Face 在 PEFT 库中对比了 LoRA 之外的多种参数高效微调技术,并指出仅凭论文结果难以判断哪种技术最优。其统计显示,Hugging Face Hub 上提及单一 PEFT 技术的 20,834 个模型卡中有 20,509 个(98.4%)提到 LoRA,外部站点 10,000 个图像生成 checkpoint 中 7,111 个为 LoRA。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,改进了药物制造中的一项关键反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可了解 AI 在化学研发中的落地方式。
OpenAI 发布 LifeSciBench,一个由专家撰写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。该基准聚焦现实科研场景,而非抽象题目。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙和树丛清单,覆盖英国超 13 万平方公里。
PyTorch 性能剖析系列第二部分用 nn.Linear(bias=True)替换手写的 matmul-add,并堆叠三层加激活构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析 profiler trace。
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,以正确转录为 chosen、退化循环为 rejected 构建偏好数据,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。
Hugging Face 发布 PyTorch 性能分析系列第一篇,讲解如何用 torch.profiler 分析矩阵乘法加法运算。
Mistral 将 Emmi AI 纳入麾下,推出面向工业工程的物理 AI 基础能力,可从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成。该能力面向设计迭代提速,传统求解器保留用于验证与边缘场景,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
Mistral AI 本周签署最终协议,收购奥地利 Physics AI 公司 Emmi AI,以强化其面向工业企业的 AI 转型服务能力。Emmi AI 专注物理 AI 与大型工程模型,可将多日计算替换为实时仿真并构建数字孪生,其 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购补齐物理仿真与工业数据能力,读者可了解其面向工程场景的 AI 布局方向。
Hugging Face 发布 OlmoEarth v1.1,一个将计算成本最多降低 3 倍、同时保持 v1 性能的地球观测模型系列。该系列通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,并修改预训练方案以避免性能下降,提供 Base、Tiny、Nano 三种规模权重及训练代码。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
推荐理由:Google 公开 ERA 在 Nature 的评测结果与八篇应用论文,读者可据此判断 AI 写科学代码的实际边界。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究:它扫描数万篇论文后提出 20 多个可测试的新遗传因子,实验室验证其中几个成功将细胞推向更年轻状态并改善整体功能。它还能将原本耗时长达六个月的筛选数据分析缩短至几天。
剑桥大学教授 Clare Bryant 使用 Google DeepMind 的 Co-Scientist 研究流感等病原体跨物种传播引发脓毒症的分子开关,该工具从她已发表的基金申请中生成并排序假说,并优先锁定了一个她此前未关注的蛋白质。加入未发表数据后,假说逐步细化到具体氨基酸,团队正构建含氨基酸突变的细胞系进行验证。Bryant 称,原本需两到三年的实验工作,如今有望在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现并生成可验证假设。在整合应激反应(ISR)研究中,该工具帮助团队提出代谢调控 ISR 的新假设,并协助优化实验设计、随结果迭代输入新信息,相关实验已产生新发现,团队计划发表结果。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假说,并已获实验验证。Co-Scientist 还梳理肝生物学与药理学证据,筛选出可供测试的候选联合疗法。