跳到正文

全部动态

今日 56 条
7月7日周二
  1. Hugging Face Blog62

    SkyPilot 与 Hugging Face 打通零出网费存储,可在任意云运行 AI 负载

    SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境上运行。

    推荐理由:原文给出 hf:// 挂载方式与免出网费的具体机制,读者可据此判断跨云训练与推理的存储成本变化。

7月6日周一
  1. Hugging Face Blog28

    PRX Part 4:我们的数据策略

    PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL、改为训练时实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练约多花 1 天)。

  2. Hugging Face Blog34

    Hugging Face Kernels 项目重大更新:新增 kernel 仓库类型与代码签名

    Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。项目还重构了 kernels 与 kernel-builder 的 CLI,新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,为智能体驱动的 kernel 开发打下基础。

7月3日周五
  1. Google DeepMind31

    Google DeepMind 与 A24 宣布首个研究型合作伙伴关系

    Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。

7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5,形式化验证性能升级并开源

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的模型,在形式化验证上大幅升级,miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。

    推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与开源入口,读者可据此判断其在 Lean 4 证明工程中的可用性。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 合作展示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为级联式模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 文本转语音,各层均可替换。

    推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合并复用到自己的项目。

  2. Hugging Face Blog39

    ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试

    Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。评测显示最强智能体行为成功率不足 10%,Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。

6月30日周二
  1. Google Research72

    Google 发布表格数据零样本基础模型 TabFM

    Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:Google 把零样本思路搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比表现。

6月27日周六
6月26日周五
6月25日周四
  1. Google Research22

    Google 用线性弹性缓存优化云成本:Spanner 内存用量降 15.5%

    Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法用浅层决策树预测页面 TTL,并已在 CIDR 发表。

  2. Hugging Face Blog62

    NVIDIA NeMo AutoModel 加速 Transformers MoE 微调

    NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%,且只需改动一行 import。

    推荐理由:原文给出同一 from_pretrained() 接口下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。

6月24日周三
6月23日周二
  1. Mistral AI71

    Mistral 发布 OCR 4,支持 170 种语言与单容器自托管

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,独立标注者在 600 多份文档的盲评中平均 72% 的情况下更偏好其输出。

    推荐理由:OCR 4 把边界框、块分类和置信度分数一并输出,读者可据此判断文档解析如何接入 RAG 与智能体流程。

  2. Hugging Face Blog62

    Hugging Face 如何用 AI 与开源工具每周发布 huggingface_hub

    Hugging Face 将 huggingface_hub 的发版周期从每 4 到 6 周缩短到每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开放权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。

    推荐理由:Hugging Face 公开了每周发版的完整 CI 流程,其中模型起草加确定性校验的循环可直接迁移到其他项目。

6月22日周一
6月19日周五
  1. Hugging Face Blog48

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。

6月18日周四
  1. Hugging Face Blog62

    Hugging Face 发布 agent-eval:在自有工具上评测开源模型的智能体表现

    Hugging Face 发布 agent-eval 工具,用于评测智能体使用某个库完成任务的全过程,而不只看最终答案,并以 transformers 为案例在模型、版本、任务三个维度上展开测试。

    推荐理由:原文给出了一套可复用的工具基准方法,并展示了同一改动对不同规模模型效果相反的具体证据。

6月17日周三
  1. Hugging Face Blog62

    用 Strands Agents 和 LeRobot 把 Hugging Face Hub 数据集接到机器人硬件

    AWS 开源的 Strands Robots SDK(Apache 2.0)把 LeRobot 栈封装成 AgentTools,让一个 Strands 智能体在单次循环里完成仿真录制演示、推送 LeRobotDataset 到 Hub、跑策略、再以改一个关键字参数的方式部署到实体 SO-101,并通过 Zenoh 对等网格广播指令到多台机器人。

    推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的五步流程,可看到仿真与真机共用同一数据集格式的工程取舍。

  2. Hugging Face Blog88

    智谱发布 GLM-5.2:面向长程任务,支持 1M 上下文并采用 MIT 开源许可

    智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文上稳定支撑长程工作,并以 MIT 开源许可发布。模型引入 IndexShare 架构,每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9 倍,同时改进 MTP 层使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文与长程编码能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。

6月13日周六
  1. Google Research34

    Google Research 研究 AI 如何帮助用户理解皮肤问题

    Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查中,2345 名参与者使用 AI 工具后尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近对照组 8% 的三倍。但 AI 组在判断下一步就医建议上未获统计显著提升,且比对照组更易给出不够紧急的建议(30% vs 27%)。