OpenAI 提出 Consistency Models 实现快速生成
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现快速生成,从而解决扩散模型因迭代采样导致的生成速度慢问题。扩散模型已在图像、音频和视频生成领域取得显著进展,但迭代采样过程拖慢了生成速度。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现快速生成,从而解决扩散模型因迭代采样导致的生成速度慢问题。扩散模型已在图像、音频和视频生成领域取得显著进展,但迭代采样过程拖慢了生成速度。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均 5.6 个测试用例、分支覆盖率 99%。
OpenAI 用可扩展的稀疏自编码器技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。这些模式对应模型内部的可解释概念特征,规模远超以往同类工作。
Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在解决这一问题。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类别评估 LLM 推理能力。
OpenAI 正在制定一套评估大语言模型可能协助制造生物威胁风险的蓝图。在生物专家与学生参与的评估中,GPT-4 对生物威胁创建准确率的提升至多为轻微程度。该提升尚不足以形成定论,但可作为后续研究与社区讨论的起点。
Hugging Face 发布 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 对多种 LLM 进行幻觉相关基准评测,覆盖闭卷问答、摘要、阅读理解、指令遵循、事实核查等任务,并已发布相关论文。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 评估框架对 LLM 安全性进行评测,该框架曾获 NeurIPS 2023 杰出论文奖。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步的积极结果。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型在安全与部署方面的评估情况。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了人类标注与 GPT-4 对开源模型输出的偏好评分。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并说明其对思维链对齐的作用。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。
OpenAI 发布题为 GPTs are GPTs 的研究,初步考察大语言模型对劳动力市场的潜在影响。材料仅提供标题,未包含正文内容。
OpenAI 研究人员与乔治城大学安全与新兴技术中心、斯坦福互联网观测台合作,调查大语言模型可能被用于虚假信息活动的风险。该合作基于一年多的研究,包括 2021 年 10 月汇集 30 位虚假信息研究者、机器学习专家与政策分析师的研讨会,最终形成联合报告,梳理语言模型对信息环境的威胁并提出潜在缓解措施的分析框架。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),覆盖 8 类任务、56 个数据集、最多 112 种语言,排行榜已汇总超 2000 条结果。该基准通过 pip install mteb 即可对任意嵌入模型评测,并将结果提交至公开排行榜,方便按速度、性能与嵌入维度筛选模型。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。
推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。
微软提出 TAPEX,通过让 BART 学习充当神经 SQL 执行器,在合成 SQL 查询语料上完成表格预训练,无需真实数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,较此前最佳提升 2.3%。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的问题。
推荐理由:OpenAI 用神经网络定理证明器在 Lean 中求解 AMC12、AIME 及两道 IMO 改编题,可了解形式化数学推理的早期进展。
OpenAI 对 GPT-3 进行微调,使其能借助基于文本的网页浏览器更准确地回答开放式问题。该工作名为 WebGPT,目标是提升语言模型回答的事实准确率。
推荐理由:OpenAI 用文本浏览器微调 GPT-3 提升开放问答事实准确率,可了解早期联网检索思路。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。该系统解出的题目数量约为真实儿童的 90%:在一组来自其数据集的测试题上,9-12 岁儿童小样本得分 60%,该系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比自家系统与微调 GPT-3 及 9-12 岁儿童的成绩,可看推理能力当时的水平参照。
OpenAI 发布文章介绍用人类反馈总结书籍,目标是扩展人类对 AI 系统在难以评估任务上的监督。材料仅提供摘要,未给出具体方法、数据或结果细节。
Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。
推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 的月度阅读小组 2021 年 2 月聚焦长程注意力,围绕 Longformer、Compressive Transformer、Linformer、Performer 四篇论文梳理了降低 Transformer 序列长度二次开销的四条路线:自定义注意力模式、循环、低秩近似与核近似。
OpenAI 在 CLIP 中发现了一类神经元,无论概念以字面、符号还是概念化方式呈现,它们都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的视觉变体,也是理解 CLIP 及同类模型所学关联与偏见的重要一步。
推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念三种呈现方式响应的神经元,为理解多模态模型的关联与偏见提供线索。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其摘要能力得到提升。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布题为 Language models are few-shot learners 的论文,讨论语言模型的少样本学习能力。该页面正文抓取失败,仅保留标题信息。
OpenAI 发布分析称,自 2012 年以来,在 ImageNet 分类上训练神经网络达到同等性能所需算力每 16 个月减少一半。与 2012 年相比,训练到 AlexNet 水平所需算力减少 44 倍,而同期摩尔定律只带来 11 倍的成本改善。OpenAI 认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,标题为 Dota 2 with large scale deep reinforcement learning。原文正文抓取失败,仅标题可用。
OpenAI 发现双重下降现象在 CNN、ResNet 和 Transformer 中普遍存在:随着模型规模、数据规模或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但其成因尚不完全清楚,OpenAI 将其视为重要研究方向。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。