跳到正文

全部动态

今日 2 条
4月9日周四
4月3日周五
4月1日周三
3月31日周二
  1. Hugging Face Blog26

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后扩展到 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月26日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI 有害操纵评测工具包

    Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具包,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度逾 1 万名参与者,开展九项研究,聚焦金融与健康等高风险场景;结果显示 AI 在健康话题上的有害操纵效果最弱,且某一领域的成功无法预测另一领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,读者可了解其研究设计与公开材料。

3月25日周三
  1. Google Research60

    Google 发布 TurboQuant 等三种向量量化算法,KV cache 可压至 3 bit

    Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。

    推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。

3月24日周二
  1. Hugging Face Blog42

    Hugging Face 推出语音智能体评估框架 EVA

    Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。

3月18日周三
3月17日周二
3月13日周五
3月12日周四
  1. Google Research66

    Google 与 BIDMC 开展对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让对话式诊断 AI AMIE 在门诊初级保健就诊前为患者采集病史,由医生通过视频实时监督。

    推荐理由:Google 与 BIDMC 首次把 AMIE 放进真实门诊流程做前瞻性可行性研究,读者可看到安全监督机制与盲评结果。

3月10日周二
3月7日周六
  1. Google Research60

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的开放语音数据集

    Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的开放语音数据集,可了解低资源语音数据的采集方法与许可条件。

3月5日周四
  1. Google Research40

    Google 用贝叶斯教学让 LLM 学会概率推理

    Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手的预测,从而学会概率推理。在五轮模拟航班推荐任务中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升了该任务表现,还能泛化到其他任务。

3月4日周三
2月19日周四
2月18日周三
2月11日周三
2月10日周二
2月4日周三
  1. Google Research28

    Google Research 提出 Sequential Attention:让 AI 模型更精简更快且不牺牲准确率

    Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练中顺序、自适应地挑选最佳组件,把子集选择直接融入训练流程,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并已用于特征选择等真实场景,兼顾效率、准确率、可解释性与大规模扩展能力。

1月28日周三
  1. Google Research62

    Google Research 论文:智能体系统扩展的量化规律

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,覆盖单智能体与独立、集中、去中心化、混合四种多智能体架构,以及 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准。

    推荐理由:通过 180 组智能体配置的对照评测,给出多智能体架构何时增益、何时拖累性能的量化规律。

1月27日周二
  1. Hugging Face Blog21

    Hugging Face 发布 Alyah:面向阿拉伯语 LLM 阿联酋方言能力的评测基准

    Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。

1月24日周六
1月23日周五
  1. Google Research31

    Google 小模型拆解式意图提取:Gemini 1.5 Flash 8B 媲美 Gemini 1.5 Pro

    Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。

1月21日周三
1月20日周二
1月16日周五
  1. Google Research34

    Google 研究:用 Pixel Watch 智能手表估算步态指标,精度媲美手机

    Google 研究团队提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭单只 Pixel Watch 的 IMU 信号和用户身高,即可直接估算步速、步长、双支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r>0.80、ICC>0.80。

1月14日周三
1月13日周二
1月10日周六
  1. Berkeley AI Research26

    伯克利提出信息驱动的成像系统设计框架,登 NeurIPS 2025

    伯克利 AI Research 提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证中,该指标正确排序了不同硬件设计,优化后性能匹配 SOTA 端到端方法,且内存与算力需求更低、无需任务专用解码器设计。

12月11日周四
  1. Google Research31

    Google 提出 Urania:用差分隐私从 AI 聊天机器人对话中挖掘使用洞察

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在人工评估中最高有 70% 的情况更受 LLM 评审青睐,但隐私预算收紧时主题覆盖度会下降。

12月9日周二