OpenAI 提出审议式对齐:推理让语言模型更安全
OpenAI 为 o1 模型提出新的对齐策略 deliberative alignment,直接向模型教授安全规范并教其如何对这些规范进行推理。该策略面向 o1 系列模型,目标是提升语言模型的安全性。
推荐理由:OpenAI 公开 o1 模型的对齐策略,读者可了解其如何把安全规范直接教给模型并让其推理。
OpenAI 为 o1 模型提出新的对齐策略 deliberative alignment,直接向模型教授安全规范并教其如何对这些规范进行推理。该策略面向 o1 系列模型,目标是提升语言模型的安全性。
推荐理由:OpenAI 公开 o1 模型的对齐策略,读者可了解其如何把安全规范直接教给模型并让其推理。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并发布首个数据集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD 三大材料数据库,形成 670 万条条目、7 种材料属性的统一数据格式,采用 CC-BY-4.0 许可。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 预处理代码。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评估。
推荐理由:OpenAI 官方系统卡披露 o1 与 o1-mini 发布前的红队测试和前沿风险评估流程,可了解其安全评估框架。
Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与榜单,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度基于 LLM-as-judge 打分。榜单采用动态评测策略,数据集与评测代码先盲测三个月再公开,随后更换新私有基准,以缓解数据污染。该基准同时覆盖多轮与单轮场景,是这一语言无关评测框架的首次应用。
BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 存在的判别力不足、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让目标模型与助手模型不再需要共享 tokenizer,可跨模型家族配对。
推荐理由:Intel Labs 与 Hugging Face 提出的跨 tokenizer 推测解码方法,给出了可对照的加速数据和 Transformers 调用方式。
OpenAI 对连续时间一致性模型进行了简化、稳定化和规模化,仅用两步采样即可达到与领先扩散模型相当的样本质量。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼(adversarial dataset refinement)方法进行改进。
OpenAI 分析了 ChatGPT 如何根据用户姓名作出不同回应,并借助 AI 研究助手保护隐私。该评估聚焦于模型响应的公平性问题。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准聚焦智能体完成机器学习工程的能力评估。
Hugging Face 的 Daily Papers 页面已收录超过 3,700 篇论文、订阅者突破 12k,作者可一键认领论文并关联模型、数据集与 demo。用户还能提交论文、用 @librarian-bot 推荐相似论文、多语言评论并借助内置翻译交流,订阅后每个工作日可收到最新论文邮件。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总时长 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全与风险方面的评估情况。原文正文未能抓取,具体评估内容与结论暂无法确认。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation),用 Llama-2-Chat-7b 以 1-3 分制对答案打分,在 Docmatix 的 200 张图像子集上评测 MPLUGDocOwl1.5 的零样本表现。
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。
Hugging Face 发布 Docmatix 文档视觉问答(DocVQA)数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。
OpenAI 提出用证明者-验证者博弈提升语言模型输出的可读性,让 AI 给出的解题过程更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信,从而增强 AI 解决方案的可核查性。
OpenAI 提出一套构建稳健自然语言分类系统的整体性方法,用于真实场景下的内容审核与不良内容检测。该方法强调从整体视角应对现实世界中的内容审核需求。
OpenAI 提出改进的一致性模型(Consistency Models)训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现快速生成,从而解决扩散模型因迭代采样导致的生成速度慢问题。扩散模型已在图像、音频和视频生成领域取得显著进展,但迭代采样过程拖慢了生成速度。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均 5.6 个测试用例、分支覆盖率 99%。
OpenAI 用可扩展的稀疏自编码器技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。这些模式对应模型内部的可解释概念特征,规模远超以往同类工作。
Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在解决这一问题。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类别评估 LLM 推理能力。
OpenAI 正在制定一套评估大语言模型可能协助制造生物威胁风险的蓝图。在生物专家与学生参与的评估中,GPT-4 对生物威胁创建准确率的提升至多为轻微程度。该提升尚不足以形成定论,但可作为后续研究与社区讨论的起点。
Hugging Face 发布 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 对多种 LLM 进行幻觉相关基准评测,覆盖闭卷问答、摘要、阅读理解、指令遵循、事实核查等任务,并已发布相关论文。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 评估框架对 LLM 安全性进行评测,该框架曾获 NeurIPS 2023 杰出论文奖。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步的积极结果。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型在安全与部署方面的评估情况。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了人类标注与 GPT-4 对开源模型输出的偏好评分。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并说明其对思维链对齐的作用。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。
OpenAI 发布题为 GPTs are GPTs 的研究,初步考察大语言模型对劳动力市场的潜在影响。材料仅提供标题,未包含正文内容。