跳到正文

#数据/训练

今日 1 条
2月16日周五
  1. Hugging Face Blog62

    Hugging Face 教程:用开源 LLM 合成数据训练定制模型,成本降至 2.7 美元

    Hugging Face 发布教程,展示如何用开源 LLM 生成合成数据来训练更小更专用的模型。案例以金融新闻投资者情绪分类为例,用 Mixtral-8x7B-Instruct-v0.1 配合 CoT 与 Self-Consistency 标注数据。

    推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。

2月1日周四
1月31日周三
1月19日周五
1月18日周四
1月10日周三
  1. Hugging Face Blog78

    用 Unsloth 和 TRL 让 LLM 微调提速 2 倍

    Hugging Face 博客介绍社区工具 Unsloth,与 transformers、PEFT、TRL 完全兼容,可将 LLM 微调速度提升约 2 倍、显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。

    推荐理由:原文给出 Unsloth 与 TRL 的完整接入代码和 59 次基准数据,读者可据此判断微调提速与显存节省幅度。

12月18日周一
12月11日周一
12月6日周三
11月9日周四
11月7日周二
10月25日周三
  1. Hugging Face Blog22

    用一行代码交互式探索你的 Hugging Face 数据集

    Hugging Face datasets 库与 Renumics Spotlight 集成,只需一行代码即可对数据集进行交互式可视化。Spotlight 直接读取 datasets 的 Arrow 表结构,无需复制或预处理数据,并支持利用模型预测和嵌入向量定位关键数据簇与模型失败模式。用户可通过 GUI 或 Python API 自定义布局,用于 EDA、模型调试和监控。

10月24日周二
10月3日周二
  1. Hugging Face Blog62

    Hugging Face tokenizers 新增 chat_template 属性,解决聊天格式错配导致的性能下降

    Hugging Face tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,避免因格式不一致造成的静默性能下降。

    推荐理由:Hugging Face 把聊天格式从 transformers 硬编码搬到 tokenizer 属性,读者可据此理解格式错配为何会静默拉低模型表现。

9月29日周五
9月28日周四
9月27日周三
  1. Mistral AI78

    Mistral AI 发布首个模型 Mistral 7B,以 Apache 2.0 开源

    Mistral AI 发布首个模型 Mistral 7B,这是一个 7B 参数模型,在全部标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。官方称这是三个月内从零搭建团队、MLops 栈与数据处理流水线的结果,同时开放 GitHub 仓库和 Discord 频道,并计划今年秋季继续发布更大模型与新架构。

    推荐理由:Mistral AI 首篇官方博客,交代开源路线与 Mistral 7B 的定位,可对照其后续模型演进。

9月15日周五
9月13日周三
9月6日周三
  1. Hugging Face Blog80

    TII 的 Falcon 180B 上线 Hugging Face

    TII 的 Falcon 180B 正式上线 Hugging Face,以 1800 亿参数成为当时最大的公开可用语言模型,基于 RefinedWeb 等数据训练了 3.5 万亿 token,使用最多 4096 张 GPU、约 700 万 GPU 小时。

    推荐理由:官方给出 180B 模型的训练规模、评测对比与显存需求,可据此判断开源大模型的部署门槛。

8月24日周四
8月22日周二
  1. OpenAI News62

    OpenAI 开放 GPT-3.5 Turbo 微调并更新 API

    OpenAI 宣布开发者可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。官方未在摘要中给出微调的具体价格、上下文长度或可用范围等细节。

    推荐理由:OpenAI 官方开放 GPT-3.5 Turbo 微调,开发者可据此判断自有数据定制模型的可行路径。

8月8日周二
8月2日周三
8月1日周二
7月17日周一
6月23日周五
6月12日周一
  1. Hugging Face Blog12

    Hugging Face Hub 如何服务美术馆、图书馆、档案馆与博物馆(GLAM)

    Hugging Face Hub 面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何查找模型、上传数据集并托管演示应用。Hub 目前托管超 190,000 个模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频等任务。文中以挪威语文献的命名实体识别(NER)模型为例,并演示通过浏览器界面上传 CSV 数据集。

6月7日周三
6月6日周二
6月5日周一
5月24日周三
  1. Hugging Face Blog78

    Hugging Face 联合 bitsandbytes 在 transformers 中支持 4-bit 量化与 QLoRA

    Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载模型,覆盖文本、视觉和多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。

    推荐理由:Hugging Face 与 bitsandbytes 合作把 4-bit 量化接入 transformers,读者可据此了解消费级硬件跑大模型的具体路径。

5月23日周二
  1. Hugging Face Blog62

    Safetensors 通过外部安全审计,Hugging Face 等三方推动其成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库做了外部安全审计,未发现可导致任意代码执行的关键安全漏洞,报告已完全公开。

    推荐理由:外部安全审计结果与三家机构推动默认格式的路线,能帮读者理解模型权重存储格式的安全取舍。

5月16日周二
5月9日周二
  1. OpenAI News61

    OpenAI 用 GPT-4 解释语言模型神经元并公开 GPT-2 数据集

    OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。

    推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。

4月27日周四
4月26日周三