跳到正文

#数据/训练

今日 5 条
12月9日周一
12月3日周二
11月20日周三
11月12日周二
  1. Hugging Face Blog22

    在 Hugging Face Hub 上分享你的开放机器学习数据集

    Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用该平台。

11月4日周一
10月24日周四
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Expanse 8B 与 32B 多语言模型

    Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数版本,并以开放权重形式提供给研究社区。在成对比较中,Aya Expanse 32B 优于 Gemma 2 27B、Mistral 8x22B 和参数量超过其两倍的 Llama 3.1 70B;Aya Expanse 8B 在同参数级别中胜率为 60.4% 至 70.6%。

    推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解多语言模型如何用数据套利、偏好训练与模型合并提升表现。

10月23日周三
10月16日周三
10月10日周四
10月9日周三
10月5日周六
  1. Hugging Face Blog26

    Hugging Face 如何改进 Hub 上 Parquet 文件的去重效率

    Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了字节级 CDC 去重效果:追加 10,000 行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量,去重率降至 89%,需额外 230MB。团队提出改用相对偏移量、按行组做内容定义分块等方案,并希望与 Apache Arrow 合作落地。

10月4日周五
  1. Hugging Face Blog28

    Hugging Face 推出 Open FinLLM Leaderboard:金融大模型专用评测榜单

    Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。

10月1日周二
  1. Hugging Face Blog22

    BenCzechMark:你的 LLM 能理解捷克语吗?

    Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并区分阅读理解、事实知识、捷克语理解、语言建模、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等类别。

9月23日周一
9月18日周三
9月17日周二
9月13日周五
8月27日周二
  1. Hugging Face Blog34

    Hugging Face LeRobot 用视频编码扩展机器人数据集

    Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积仅为原始版本的 14%,最佳情况下可低至 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅需其 25%-50%。该格式轻量、易分享,并原生集成 Hub,还提供可视化工具浏览数据集。

8月21日周三
8月14日周三
8月8日周四
  1. Hugging Face Blog62

    Hugging Face 收购 XetHub,将用自研存储后端替换 Git LFS

    Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,团队共 12 人。XetHub 的技术让 Git 能扩展到 TB 级仓库,HF CTO Julien Chaumond 表示该团队将帮助 Hub 把存储后端从 Git LFS 换成自研的更好版本。

    推荐理由:Hugging Face 官方披露收购 XetHub 的动机与存储后端替换计划,可了解 Hub 未来在超大模型与数据集上的版本管理方向。

8月6日周二
  1. Hugging Face Blog32

    Hugging Face 联合 Albumentations AI 推出文档图像 TextImage 数据增强

    Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像内容与文本标注。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合黑化与 inpaint 保持文本质量,还可用任意文本合成新样本。初始版本中的同义词替换因耗时过高已被移除。

7月18日周四
7月16日周二
  1. Hugging Face Blog22

    如何用 distilabel 打造 Argilla 2.0 聊天机器人

    这篇教程演示如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档切分约 256 token 的 chunk 并生成合成数据集,再微调领域专用嵌入模型、搭建向量数据库,最后将 Gradio 应用部署到 Hugging Face Space,并把对话存入 Argilla 持续评估改进。

7月10日周三
  1. Hugging Face Blog34

    Hugging Face TRL 库新增 VLM 的 DPO 偏好优化支持

    Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。

7月8日周一
  1. Hugging Face Blog22

    Hugging Face Dataset Hub 新增四项数据集搜索功能

    Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按 Text、Image、Audio 等模态及最小/最大行数过滤,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性筛选。这些筛选可与语言、任务、许可证等现有条件组合使用,覆盖 Hub 上超过 180,000 个公开数据集。

7月3日周三
6月27日周四
6月24日周一
  1. Hugging Face Blog36

    微调 Florence-2:微软的前沿视觉语言模型

    微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。在 DocVQA 数据集上微调七个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者建议用 The Cauldron 进一步微调以获得更强的 VQA 模型。

  2. Hugging Face Blog22

    Hugging Face 伦理与社会通讯第6期:构建更好的 AI,数据质量为何至关重要

    Hugging Face 发布《伦理与社会通讯》第6期,聚焦 AI 数据质量。文章指出高质量数据并非仅指准确或量大,而应契合具体用途,需具备相关性、全面性、时效性并减少偏见。数据质量直接影响模型性能、鲁棒性、效率与公平性,应从 AI 开发全生命周期加以重视。

6月20日周四
6月13日周四
6月12日周三
6月5日周三
  1. Mistral AI62

    Mistral 在 la Plateforme 推出模型定制与微调服务

    Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:面向自建基础设施的开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。

    推荐理由:Mistral 给出微调的三条落地路径与 LoRA 效率对比,读者可据此判断自建还是托管微调更合适。

5月28日周二
5月16日周四