跳到正文

全部动态

今日 0 条
4月9日周四
  1. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型,面向消费级 GPU

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。

    推荐理由:Waypoint-1.5 把实时世界模型从数据中心拉到消费级显卡,读者可据此判断本地交互式生成世界的硬件门槛。

  2. Hugging Face Blog60

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态嵌入与重排模型。嵌入模型把不同模态映射到共享向量空间,重排模型对混合模态输入对打分,可用于视觉文档检索、跨模态搜索和多模态 RAG。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索如何接入现有 RAG 流程。

4月8日周三
4月6日周一
4月3日周五
4月2日周四
  1. OpenAI News62

    OpenAI 收购 TBPN

    OpenAI 宣布收购 TBPN,称此举旨在加速围绕 AI 的全球对话并支持独立媒体,扩大与开发者、企业和更广泛科技社区的交流。

    推荐理由:OpenAI 收购 TBPN 的官方说明,可了解其借媒体渠道扩大 AI 对话的布局方向。

4月1日周三
  1. Hugging Face Blog62

    Hugging Face 推出 gradio.Server,让任意前端接入 Gradio 后端

    Hugging Face 发布 gradio.Server,它扩展自 FastAPI,允许用 React、Svelte 或原生 HTML/JS 自建前端,同时保留 Gradio 的排队、SSE 流式、并发控制、MCP 支持和 Spaces 上的 ZeroGPU。

    推荐理由:官方给出 gradio.Server 的完整示例与代码,读者可据此判断自建前端如何复用 Gradio 的队列与 GPU 能力。

3月31日周二
  1. Hugging Face Blog26

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后扩展到 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

  2. Hugging Face Blog62

    Hugging Face 发布 TRL v1.0 后训练库

    Hugging Face 发布 TRL v1.0,将其从研究代码库转为带明确稳定性承诺的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。稳定核心遵循语义化版本,覆盖 SFT、DPO、Reward modeling、RLOO 和 GRPO 等训练器;实验层不承诺兼容,新方法先在此落地。从最后一个 0.x 版本迁移改动很小,官方提供了迁移指南。

    推荐理由:官方说明 TRL v1.0 的稳定与实验分层设计,读者可据此判断后训练库的选型与迁移成本。

3月30日周一
3月29日周日
3月28日周六
3月27日周五
3月26日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低,已通过 Gemini Live API 在 Google AI Studio 预览,并接入 Gemini Enterprise for Customer Experience、Search Live 和 Gemini Live。

    推荐理由:官方给出语音模型的延迟、推理基准与多语言覆盖变化,可据此判断语音智能体的可用边界。

  2. Google DeepMind62

    Google DeepMind 发布 AI 有害操纵评测工具包

    Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具包,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度逾 1 万名参与者,开展九项研究,聚焦金融与健康等高风险场景;结果显示 AI 在健康话题上的有害操纵效果最弱,且某一领域的成功无法预测另一领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,读者可了解其研究设计与公开材料。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的物理感知 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 把 Gemini 与 XR Blocks 组合成从自然语言到 Android XR 应用的生成流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发的门槛变化。

  2. OpenAI News60

    OpenAI 推出安全漏洞赏金计划

    OpenAI 推出 Safety Bug Bounty 计划,用于识别 AI 滥用与安全风险,覆盖范围包括智能体漏洞、提示注入和数据外泄。

    推荐理由:OpenAI 官方公布安全漏洞赏金计划,读者可了解其覆盖的智能体漏洞与提示注入等风险范围。

  3. Google Research60

    Google 发布 TurboQuant 等三种向量量化算法,KV cache 可压至 3 bit

    Google 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 上展示。

    推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度下把 KV cache 压到 3 bit,读者可了解其压缩思路与实测收益。

3月24日周二
  1. Hugging Face Blog42

    Hugging Face 推出语音智能体评估框架 EVA

    Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。

  2. Mistral AI69

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可生成带情感表达的语音并支持零样本跨语言音色适配。

    推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开了与 ElevenLabs 的人工对比结果。

3月23日周一