跳到正文

全部动态

今日 2 条
3月15日周五
3月5日周二
  1. Hugging Face Blog27

    UCLA 团队发布 ConTextual:多模态模型在文本密集场景中的图文联合推理评测基准

    UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。

2月23日周五
2月20日周二
2月2日周五
1月31日周三
1月29日周一
1月26日周五
12月14日周四
12月6日周三
12月1日周五
  1. Hugging Face Blog34

    Open LLM Leaderboard 深度解析 DROP 基准评分异常

    Open LLM Leaderboard 新增 DROP 基准后,绝大多数模型 f1-score 低于 10 分。Hugging Face 排查发现,归一化步骤会忽略后接非空格空白符的数字答案,且以 . 作为停止词会截断浮点答案、让长回答的高质量模型 f1 更低。改用 \n 作为停止词重新计算后,分数与模型整体表现的相关性明显改善。

6月12日周一
5月31日周三
  1. OpenAI News62

    OpenAI 用过程监督提升数学推理能力

    OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处:直接训练模型产出被人类认可的思维链。

    推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并说明其对思维链对齐的作用。

5月9日周二
  1. OpenAI News61

    OpenAI 用 GPT-4 解释语言模型神经元并公开 GPT-2 数据集

    OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。

    推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。

3月17日周五
1月11日周三
  1. OpenAI News38

    OpenAI 与乔治城大学、斯坦福互联网观测台联合研究语言模型被用于虚假信息活动的潜在风险

    OpenAI 研究人员与乔治城大学安全与新兴技术中心、斯坦福互联网观测台合作,调查大语言模型可能被用于虚假信息活动的风险。该合作基于一年多的研究,包括 2021 年 10 月汇集 30 位虚假信息研究者、机器学习专家与政策分析师的研讨会,最终形成联合报告,梳理语言模型对信息环境的威胁并提出潜在缓解措施的分析框架。

10月19日周三
9月26日周一
6月23日周四
  1. OpenAI News71

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。

    推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。

6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。

    推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。

5月23日周一
2月2日周三
12月16日周四
9月23日周四
7月15日周四
  1. Hugging Face Blog62

    Hugging Face 提出 DeDLOC 协作训练方法,40 名志愿者预训练出孟加拉语模型 sahajBERT

    Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。

    推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。

6月10日周四
3月9日周二
3月4日周四
  1. OpenAI News62

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现了一类神经元,无论概念以字面、符号还是概念化方式呈现,它们都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的视觉变体,也是理解 CLIP 及同类模型所学关联与偏见的重要一步。

    推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念三种呈现方式响应的神经元,为理解多模态模型的关联与偏见提供线索。

9月4日周五
6月17日周三
  1. OpenAI News62

    OpenAI 发布 Image GPT:用 Transformer 生成图像

    OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。

    推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。

5月28日周四
5月5日周二
  1. OpenAI News62

    OpenAI 分析:ImageNet 训练算力每 16 个月减半

    OpenAI 发布分析称,自 2012 年以来,在 ImageNet 分类上训练神经网络达到同等性能所需算力每 16 个月减少一半。与 2012 年相比,训练到 AlexNet 水平所需算力减少 44 倍,而同期摩尔定律只带来 11 倍的成本改善。OpenAI 认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。

    推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对照理解 AI 效率来源。

12月13日周五
12月5日周四
12月3日周二
11月21日周四
10月15日周二
  1. OpenAI News71

    OpenAI 用机械手解魔方:纯仿真训练加 ADR

    OpenAI 训练了一对神经网络,让类人机械手还原魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰。OpenAI 表示这说明强化学习不只是虚拟任务的工具,也能解决需要前所未有灵巧度的物理世界问题。

    推荐理由:OpenAI 用同一套强化学习代码加 ADR 让机械手在仿真中学会还原魔方,可看仿真到现实迁移的早期思路。

9月19日周四
  1. OpenAI News62

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自身一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制,该任务需要 60k 条人类标注;而按不同风格续写文本等更简单的任务只需 5k 条标注。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类偏好微调 GPT-2 的早期实验,展示了标注偏好如何直接塑造模型行为。

9月17日周二
  1. OpenAI News62

    OpenAI 在多智能体捉迷藏环境中观察到智能体自发使用工具

    OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。

    推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。