OpenAI 发布 Point-E:从复杂提示词生成 3D 点云
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
OpenAI 训练并发布名为 ChatGPT 的模型,以对话方式与用户交互。官方称对话格式使其能回答追问、承认自身错误、质疑错误前提并拒绝不当请求。
推荐理由:OpenAI 官方发布 ChatGPT,说明其对话式交互与追问、纠错、拒绝不当请求等能力。
OpenAI 宣布 DALL·E API 即日起开放公开测试,开发者可以开始用它构建应用。原文未披露具体定价、调用限制或可用模型版本。
推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。
Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。
推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。
OpenAI 宣布 DALL·E 不再需要等待名单,新用户可以直接开始创作。官方表示,部署中积累的经验以及对安全系统的改进,使更广泛的开放成为可能。
推荐理由:OpenAI 官方说明 DALL·E 取消等待名单,并交代安全系统改进是放开可用性的前提。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,称其在英语语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语语音识别上的鲁棒性与准确率定位。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费积分生成图像,也可按 115 次生成 15 美元的价格购买额外积分。
推荐理由:OpenAI 公布 DALL·E 测试版开放规模与积分定价,可据此了解早期图像生成产品的使用门槛。
OpenAI 公布 DALL·E 2 研究预览进展,来自 118 个以上国家的 3000 多名艺术家已将 DALL·E 纳入自己的创作流程。OpenAI 表示,早期访问组的艺术家帮助发现了 DALL·E 的新用途,并在其决定 DALL·E 功能时提供了关键意见。
推荐理由:官方披露 DALL·E 2 研究预览的艺术家使用规模,可了解早期创作者如何把它接入创作流程。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:官方披露 DALL·E 2 研究预览的早期使用规模与每周放量节奏,可了解其安全流程的迭代方式。
OpenAI 发布 GPT-3 和 Codex 的新版本,可在已有文本中编辑或插入内容,而不再只是续写现有文本。
推荐理由:OpenAI 官方说明 GPT-3 与 Codex 新增编辑和插入能力,可了解其从续写扩展到改写已有文本。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的问题。
推荐理由:OpenAI 用神经网络定理证明器在 Lean 中求解 AMC12、AIME 及两道 IMO 改编题,可了解形式化数学推理的早期进展。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用对齐研究中的人类反馈方法。这些模型现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 官方说明 InstructGPT 通过人类反馈训练,在遵循用户意图、真实性和毒性控制上优于 GPT-3,并已成为 API 默认模型。
OpenAI 在 API 中推出 embeddings 新端点,用于自然语言和代码任务。该端点支持语义搜索、聚类、主题建模和分类等场景。
推荐理由:OpenAI 在 API 中新增 embeddings 端点,读者可了解它支持语义搜索、聚类、主题建模与分类等任务。
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。该工作名为 WebGPT,目标是提升语言模型回答的事实准确率。
推荐理由:OpenAI 用文本浏览器微调 GPT-3 提升开放问答事实准确率,可了解早期联网检索思路。
OpenAI 宣布其 API 不再需要等待名单即可使用,官方称更广泛的可用性得益于安全方面的进展。
推荐理由:OpenAI 官方宣布 API 取消等待名单,读者可据此了解其开放范围与安全进展的关系。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。该系统解出的题目数量约为真实儿童的 90%:在一组来自其数据集的测试题上,9-12 岁儿童小样本得分 60%,该系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比自家系统与微调 GPT-3 及 9-12 岁儿童的成绩,可看推理能力当时的水平参照。
OpenAI 发布 Triton 1.0,这是一门开源的类 Python 编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,多数情况下能达到专家水准。Triton 1.0 以开源形式发布。
推荐理由:OpenAI 官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。