跳到正文

全部动态

今日 0 条
1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本。

1月27日周二
  1. Hugging Face Blog21

    Hugging Face 发布 Alyah:面向阿拉伯语 LLM 阿联酋方言能力的评测基准

    Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。

  2. Hugging Face Blog38

    解锁 GPT-OSS 的智能体 RL 训练:一次实践复盘

    Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。

1月26日周一
1月24日周六
1月23日周五
  1. Google Research31

    Google 小模型拆解式意图提取:Gemini 1.5 Flash 8B 媲美 Gemini 1.5 Pro

    Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。

1月22日周四
1月21日周三
1月20日周二
  1. Hugging Face Blog71

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。

    推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。

1月18日周日
1月16日周五
  1. OpenAI News62

    OpenAI 面向全球推出 ChatGPT Go

    OpenAI 宣布 ChatGPT Go 已在全球上线,提供 GPT-5.2 Instant 的扩展访问、更高的使用额度和更长的记忆能力。官方称该档位让先进 AI 在全球范围内更可负担。

    推荐理由:官方给出 ChatGPT Go 的全球开放范围与三项能力变化,可据此判断低价档位的实际可用边界。

  2. OpenAI News62

    OpenAI 计划在美国为 ChatGPT 免费与 Go 档测试广告

    OpenAI 计划在美国为 ChatGPT 的免费档和 Go 档测试广告,以扩大全球范围内可负担的 AI 使用渠道。官方表示测试过程中会保护隐私、信任与回答质量。

    推荐理由:OpenAI 官方说明 ChatGPT 免费与 Go 档将试水广告,可据此观察其商业化与可及性之间的取舍。

  3. Google Research34

    Google 研究:用 Pixel Watch 智能手表估算步态指标,精度媲美手机

    Google 研究团队提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭单只 Pixel Watch 的 IMU 信号和用户身高,即可直接估算步速、步长、双支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r>0.80、ICC>0.80。

1月15日周四
1月14日周三
  1. Google DeepMind71

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,支持原生竖屏与 1080p/4K 放大

    Google DeepMind 更新 Veo 3.1 的 Ingredients to Video 能力,让基于参考图生成的视频在简单提示词下也有更丰富的对白与叙事,并提升角色、背景和物体的一致性。

    推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得切换。