跳到正文

#Google

今日 0 条
4月27日周四
2月7日周二
1月24日周二
  1. Hugging Face Blog52

    Hugging Face 解读对话智能体为何有用:IFT、SFT、CoT 与 RLHF 的分工

    Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)提示和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、训练数据、模型架构与评测方向上的差异。

12月9日周五
  1. Hugging Face Blog62

    图解 RLHF:从预训练、奖励模型到 PPO 微调

    Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。

10月13日周四
8月19日周五
8月18日周四
7月25日周一
3月23日周三
  1. Hugging Face Blog22

    Hugging Face 机器学习专家访谈:Margaret Mitchell 谈伦理 AI

    Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。她因在微软 Seeing AI 项目中目睹图像数据偏差而转向伦理 AI,指出 ML 团队普遍缺乏相关概念与词汇,且行业"Alpha"文化使女性主导的伦理研究被轻视。

3月2日周三
2月11日周五
12月15日周三
  1. Hugging Face Blog62

    Hugging Face 将 Perceiver IO 加入 Transformers,支持任意模态

    Hugging Face 将 Google DeepMind 的 Perceiver IO 加入 Transformers 库,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。

    推荐理由:Hugging Face 官方详解 Perceiver IO 的接入方式,读者可据此了解这套架构如何处理文本、图像、音频等多模态输入。

10月25日周一
3月18日周四
2月9日周二
6月20日周六
3月6日周三
6月21日周二