Be My Eyes 用 GPT-4 改变视觉无障碍体验
Be My Eyes 借助 GPT-4 改变视觉无障碍体验。该应用利用 GPT-4 为视障用户提供视觉辅助能力。
Be My Eyes 借助 GPT-4 改变视觉无障碍体验。该应用利用 GPT-4 为视障用户提供视觉辅助能力。
Stripe 利用 GPT-4 简化用户体验并打击欺诈。OpenAI 与 Stripe 合作,将 GPT-4 应用于其支付平台,以提升用户交互效率并加强反欺诈能力。
Khan Academy 正在一项有限试点项目中探索 GPT-4 用于虚拟课堂教育的潜力。该试点聚焦 GPT-4 在教学场景中的应用可能性。
OpenAI 发布 GPT-4,可用于创意与技术写作任务。它能在写歌、写剧本等场景中生成、编辑内容,并与用户反复迭代,还能学习用户的写作风格。
推荐理由:官方给出 GPT-4 在创意与技术写作上的生成、编辑与风格学习能力,可据此判断写作类任务的可用边界。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(即比人类更聪明的 AI 系统)造福全人类。该文为 OpenAI 官方对 AGI 长期规划的表态,目前仅提供摘要。
OpenAI 正在澄清 ChatGPT 的行为是如何被塑造的,并公布改进计划:让用户拥有更多自定义空间,同时让公众更多地参与相关决策。
Hugging Face 的 AI for Game Development 系列教程第五篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,再通过多轮对话要求其更具原创性并去除魔法元素,最后生成游戏与商店物品描述。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)提示和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、训练数据、模型架构与评测方向上的差异。
OpenAI 宣布与 Microsoft 延长双方的合作关系。该消息由 OpenAI 官方发布,未披露合作延长的具体条款、期限或范围。
推荐理由:OpenAI 官方宣布与 Microsoft 延长合作,可据此了解双方既有合作关系的延续动向。
OpenAI 研究人员与乔治城大学安全与新兴技术中心、斯坦福互联网观测台合作,调查大语言模型可能被用于虚假信息活动的风险。该合作基于一年多的研究,包括 2021 年 10 月汇集 30 位虚假信息研究者、机器学习专家与政策分析师的研讨会,最终形成联合报告,梳理语言模型对信息环境的威胁并提出潜在缓解措施的分析框架。
OpenAI 使用 GPT-3 从客户反馈中快速提炼细致洞察。该能力面向客户反馈分析场景,可输出更细腻的结论。
OpenAI 通过微调 GPT-3 来驱动并规模化"代客制作"的视频创作。原文未披露微调数据规模、具体版本号或性能指标。
OpenAI 正利用 GPT-3 创建新一代由 AI 驱动的角色。
OpenAI 应用 AI 研究团队的 Lilian Weng 分享了关于持续学习的内容。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
OpenAI 超算团队工程师 Christian Gibson 分享了对后端系统细节的探索。他隶属于 OpenAI 的 Supercomputing 团队。
OpenAI 训练并发布名为 ChatGPT 的模型,以对话方式与用户交互。官方称对话格式使其能回答追问、承认自身错误、质疑错误前提并拒绝不当请求。
推荐理由:OpenAI 官方发布 ChatGPT,说明其对话式交互与追问、纠错、拒绝不当请求等能力。
OpenAI 宣布 DALL·E API 即日起开放公开测试,开发者可以开始用它构建应用。原文未披露具体定价、调用限制或可用模型版本。
推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。
Hugging Face 发布教程,逐步讲解如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖模型原理、Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估和 Gradio 演示。
推荐理由:完整给出用 Transformers 微调 Whisper 的代码流程,并以 8 小时印地语数据把 WER 从 63.5% 降到 32.0% 作为可参照结果。
OpenAI 宣布 DALL·E 不再需要等待名单,新用户可以直接开始创作。官方表示,部署中积累的经验以及对安全系统的改进,使更广泛的开放成为可能。
推荐理由:OpenAI 官方说明 DALL·E 取消等待名单,并交代安全系统改进是放开可用性的前提。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,称其在英语语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语语音识别上的鲁棒性与准确率定位。
OpenAI 正在提升 AI 系统从人类反馈中学习、并协助人类评估 AI 的能力,目标是构建一个足够对齐的 AI 系统,再由它帮助解决其余所有对齐问题。
OpenAI 发布新版内容审核工具 Moderation 端点,改进此前的内容过滤器,即日起免费向 OpenAI API 开发者开放。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费积分生成图像,也可按 115 次生成 15 美元的价格购买额外积分。
推荐理由:OpenAI 公布 DALL·E 测试版开放规模与积分定价,可据此了解早期图像生成产品的使用门槛。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以减少偏见并提升安全性。
OpenAI 公布 DALL·E 2 研究预览进展,来自 118 个以上国家的 3000 多名艺术家已将 DALL·E 纳入自己的创作流程。OpenAI 表示,早期访问组的艺术家帮助发现了 DALL·E 的新用途,并在其决定 DALL·E 功能时提供了关键意见。
推荐理由:官方披露 DALL·E 2 研究预览的艺术家使用规模,可了解早期创作者如何把它接入创作流程。
为向更广泛受众开放 DALL·E 2,OpenAI 在预训练阶段采取缓解措施,以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护栏,防止生成图像违反其内容政策。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。
大型神经网络是近期许多 AI 进展的核心,但训练它们是一项艰巨的工程与研究挑战,需要协调一整个 GPU 集群来完成单次同步计算。
Cohere、OpenAI 和 AI21 Labs 共同制定了一套初步的大语言模型最佳实践,适用于任何开发或部署大语言模型的组织。
OpenAI Codex 现已通过 OpenAI API 为 70 款不同应用提供支持,覆盖多种使用场景。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:官方披露 DALL·E 2 研究预览的早期使用规模与每周放量节奏,可了解其安全流程的迭代方式。
OpenAI 宣布多项高管职位变动,称此次调整反映了公司近期进展,并将确保继续推进下一阶段重大里程碑。
OpenAI 探讨了 Goodhart 定律在 AI 目标优化中的体现:当一个度量指标变成目标时,它就不再是好的度量。OpenAI 指出,在优化难以衡量或衡量成本高昂的目标时,必须应对这一问题。
OpenAI 发布 GPT-3 和 Codex 的新版本,可在已有文本中编辑或插入内容,而不再只是续写现有文本。
推荐理由:OpenAI 官方说明 GPT-3 与 Codex 新增编辑和插入能力,可了解其从续写扩展到改写已有文本。
OpenAI 分享了在已部署模型的安全与滥用问题上的最新思考,希望帮助其他 AI 开发者应对同类问题。
OpenAI 发起意向征集,邀请研究者申请参与大语言模型经济影响的研究。该征集面向有意研究 LLM 经济影响的各方,具体参与方式和研究范围尚未在文中披露。