跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

110条精选相关主题论文研究部署工程模型发布

最新精选

第 81–100 条 · 共 110 条
9月13日周三
9月6日周三
  1. Hugging Face Blog80

    TII 的 Falcon 180B 上线 Hugging Face

    TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。

    推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。

8月22日周二
  1. OpenAI News62

    OpenAI 开放 GPT-3.5 Turbo 微调并更新 API

    OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。

    推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。

8月8日周二
6月5日周一
5月24日周三
  1. Hugging Face Blog78

    Hugging Face 联合 bitsandbytes 在 transformers 中支持 4-bit 量化与 QLoRA

    Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载模型,覆盖文本、视觉和多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。

    推荐理由:Hugging Face 与 bitsandbytes 合作把 4-bit 量化接入 transformers,读者可据此了解消费级硬件跑大模型的具体路径。

5月23日周二
  1. Hugging Face Blog62

    Safetensors 通过外部安全审计,Hugging Face 等三方推动其成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库做了外部安全审计,未发现可导致任意代码执行的关键安全漏洞,报告已完全公开。

    推荐理由:外部安全审计结果与三家机构推动默认格式的路线,能帮读者理解模型权重存储格式的安全取舍。

5月9日周二
  1. OpenAI News61

    OpenAI 用 GPT-4 解释语言模型神经元并公开 GPT-2 数据集

    OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。

    推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。

4月5日周三
3月9日周四
  1. Hugging Face Blog66

    Hugging Face 集成 trl 与 peft,在 24GB 消费级 GPU 上完成 20B LLM 的 RLHF 微调

    Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。方案结合 8-bit 矩阵乘法、低秩适配器和 peft 的 disable_adapters 机制,用同一份模型同时充当参考模型与活动模型,从而省去第二份模型副本。

    推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到其他显存受限的训练场景。

2月10日周五
9月26日周一
7月12日周二
  1. Hugging Face Blog78

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型在透明度上的做法。

6月23日周四
  1. OpenAI News71

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。

    推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。

6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还显示,模型越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升,这为用 AI 系统辅助人类监督 AI 系统提供了可能。

    推荐理由:OpenAI 用自训练模型写批评来辅助人类发现摘要缺陷,并给出模型规模与批评能力的关系。

6月7日周二
7月15日周四
  1. Hugging Face Blog62

    Hugging Face 提出 DeDLOC 协作训练方法,40 名志愿者预训练出孟加拉语模型 sahajBERT

    Hugging Face 等机构提出 DeDLOC 协作分布式训练方法,可自适应参与者的网络与硬件条件,并用 40 名志愿者预训练出孟加拉语模型 sahajBERT。

    推荐理由:DeDLOC 用 40 名志愿者和家用 GPU 预训练出孟加拉语模型,读者可了解分布式协作训练如何绕开算力门槛。

1月19日周二
6月17日周三
  1. OpenAI News62

    OpenAI 发布 Image GPT:用 Transformer 生成图像

    OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一套模型在像素序列上训练后也能生成连贯的图像补全与样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所包含的特征可与顶级卷积网络竞争。

    推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。

5月28日周四