跳到正文

全部动态

今日 4 条
9月2日周二
9月1日周一
  1. Berkeley AI Research24

    word2vec 究竟学到了什么?伯克利提出可定量预测的学习理论

    伯克利 AI 研究团队证明,在若干温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,其梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率 P(i,j) 与一元概率 P(i) 定义,从小初始化训练时模型按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。

8月28日周四
8月27日周三
8月26日周二
8月22日周五
8月21日周四
  1. Hugging Face Blog60

    NVIDIA 发布 600 万多语言推理数据集 Nemotron Post-Training Dataset V2

    NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万多语言推理样本。

    推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与筛选比例,读者可据此了解后训练数据的翻译与幻觉控制方法。

8月19日周二
8月18日周一
8月14日周四
8月13日周三
  1. Hugging Face Blog60

    Arm 与 ExecuTorch 0.7 默认启用 KleidiAI,让旧款 Arm 设备也能跑生成式 AI

    Arm 与 ExecuTorch 0.7 beta 将默认启用 KleidiAI,为基于最新 Arm CPU 架构以及大量旧款手机的设备带来自动加速,Android 与跨平台开发者无需改代码即可通过 ExecuTorch 和 XNNPack 获得优化。

    推荐理由:Arm 与 ExecuTorch 团队说明了 KleidiAI 默认启用后,旧款 Arm 设备也能跑起端侧 LLM 的路径与实测数据。

8月12日周二
8月8日周五
  1. Hugging Face Blog62

    Hugging Face 发布 AI Sheets:用开放 AI 模型处理数据集的无代码工具

    Hugging Face 发布开源无代码工具 AI Sheets,可在表格界面中通过提示词构建、转换和丰富数据集,支持调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss)或本地模型。

    推荐理由:Hugging Face 官方开源的无代码数据集工具,读者可了解如何用开放模型批量构建、标注和评测数据。

8月7日周四
  1. OpenAI News82

    OpenAI 在 API 平台发布 GPT-5

    OpenAI 在 API 平台发布 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。

    推荐理由:OpenAI 官方在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。

  2. OpenAI News67

    OpenAI 发布 GPT-5,定位企业 AI 与自动化

    OpenAI 发布 GPT-5,称其为公司目前最先进的模型,面向企业 AI、自动化和办公效率场景。官方将其定位为智能工作新时代的推动力。

    推荐理由:OpenAI 官方对 GPT-5 的定位说明,可了解其面向企业 AI 与自动化场景的落点。

  3. OpenAI News85

    OpenAI 发布 GPT-5

    OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方向达到 SOTA 表现。

    推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位,可作为了解该模型代际变化的官方口径。

  4. OpenAI News83

    OpenAI 发布 GPT-5 系统卡

    OpenAI 发布 GPT-5 系统卡,说明其统一模型路由系统如何调度 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,以针对不同任务和开发者用途提供快速或更强的响应。

    推荐理由:官方系统卡披露 GPT-5 的统一模型路由机制,读者可了解不同任务如何被分配到对应模型。

  5. Hugging Face Blog60

    TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

    Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

    推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。

  6. OpenAI News62

    OpenAI 发布 GPT-5 首次上手预览

    OpenAI 发布 GPT-5 的首次上手预览,展示一组资深开发者第一次使用 GPT-5 的过程。

    推荐理由:OpenAI 官方放出 GPT-5 的首次上手片段,可据此了解开发者实际使用这款新模型的场景。

8月6日周三
8月5日周二
  1. OpenAI News62

    OpenAI 发布其能力最强的开放权重模型

    OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、更灵活、更易在全球获取的重要一步。官方表示,此举服务于让尽可能多的人用上 AI 的使命,AI 的下一个前沿不只关乎能力,也关乎谁能使用它。

    推荐理由:OpenAI 官方宣布发布其能力最强的开放权重模型,读者可据此了解其开放策略的最新落点。

  2. OpenAI News84

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:OpenAI 以 Apache 2.0 开源两款不同规模权重模型,可据此判断本地部署与工具调用的可选范围。