Falcon 模型家族落地 Hugging Face 生态
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 与 Falcon-7B 两个基础模型及对应 instruct 版本。
推荐理由:以 Apache 2.0 开源的 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径被完整拆解,可据此判断开源大模型落地成本。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 与 Falcon-7B 两个基础模型及对应 instruct 版本。
推荐理由:以 Apache 2.0 开源的 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径被完整拆解,可据此判断开源大模型落地成本。
Hugging Face 发布教程,演示如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,把玩家语音转成文本,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从搭建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API。
OpenAI 启动网络安全资助计划,通过资助及其他支持方式,推动面向防御方的 AI 网络安全能力建设。
Hugging Face 宣布举办首届 Open Source AI Game Jam,活动时间为 7 月 7 日至 9 日,参与者需在周末内用 AI 工具做出一款游戏。
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并说明其对思维链对齐的作用。
Hugging Face 发布 LLM Inference DLC,可在 Amazon SageMaker 上部署开源大语言模型,底层由 Text Generation Inference(TGI)驱动,支持 Tensor Parallelism、bitsandbytes 量化和连续批处理。
Hugging Face 宣布将主题建模工具 BERTopic 集成到 Hugging Face Hub,用户可直接在 Hub 上访问和共享 BERTopic 模型。BERTopic 基于 Transformer 嵌入向量与 c-TF-IDF 生成可解释的主题,此次集成让主题模型的发布、复用和协作更便捷。
OpenAI 旗下非营利组织 OpenAI, Inc. 启动一项资助计划,将发放十笔 10 万美元的资助金,用于资助在法律允许范围内建立民主流程、决定 AI 系统应遵循何种规则的实验。
Hugging Face 借助 OpenVINO 的 NNCF 与 Optimum,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet,在 Intel CPU 上实现 5.1 倍推理加速和 4 倍模型体积缩减。优化从 Pokemons 数据集微调模型出发,仅需 4096 次迭代、单张 24GB 显存 GPU 不到一天即可完成。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载模型,覆盖文本、视觉和多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 与 bitsandbytes 合作把 4-bit 量化接入 transformers,读者可据此了解消费级硬件跑大模型的具体路径。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在数分钟内将模型部署到托管端点进行实时推理。该目录已在所有支持 Azure Machine Learning 的区域开放公开预览。
Hugging Face 宣布与 IBM 合作,其开源库被集成进 IBM 新一代企业 AI 工作室 watsonx.ai。watsonx.ai 基于 RedHat OpenShift 构建,提供云端和本地部署两种方式,集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 开源库。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库做了外部安全审计,未发现可导致任意代码执行的关键安全漏洞,报告已完全公开。
推荐理由:外部安全审计结果与三家机构推动默认格式的路线,能帮读者理解模型权重存储格式的安全取舍。
Hugging Face 博客介绍如何借鉴 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题,即未来能力远超 AGI 的 AI 系统。文章未给出具体治理方案或时间表,仅强调当下是着手讨论这一议题的合适时机。
OpenAI 发布 ChatGPT iOS 应用,支持对话同步和语音输入,并将最新的模型改进带到移动端。
推荐理由:OpenAI 官方公布 ChatGPT iOS 应用,说明对话同步与语音输入两项能力,可据此了解其移动端入口的初始形态。
Hugging Face 博客分享了 BigCode 项目在大规模代码数据集上做近重复数据删除(near-deduplication)的实践,采用 MinHash + LSH 方法,参数为 (256, 0.7, 5)。该工作延续自 BigScience 的 ROOTS 语料去重经验,此前已确认去重能提升代码模型表现,同时使用更小的数据集。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 被法国数据保护机构 CNIL 选中,加入其强化支持计划。该计划从 40 多个候选企业中选出三家“具有强劲经济发展潜力”的公司,为其理解和履行数据保护义务提供支持。Hugging Face 表示,此前 BigScience 和 BigCode 项目已在数据选择、治理与假名化工具方面投入隐私保护工作。
Hugging Face 博客介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优点,并已被集成进 transformers 库。
推荐理由:文章解释了 RWKV 如何把 RNN 的推理效率与 Transformer 的并行训练结合,并给出可直接运行的代码示例。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley 等团队基于 LLaMA 微调,训练成本约 300 美元,据 GPT-4 评估其质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。
推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。
OpenAI 使用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了覆盖 GPT-2 每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并打分 GPT-2 神经元行为,公开了逐神经元解释数据集,可供研究模型可解释性方法。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder,用 OpenAssistant 对话数据集微调出编程助手 StarChat,并开源了代码、数据集与模型。
推荐理由:完整给出了从对话提示词到 ChatML 格式、标签掩码与 DeepSpeed ZeRO-3 微调的可复现流程,并附代码与数据集链接。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则采用扩散模型。
Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。
推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。
Hugging Face Unity API 将 Hugging Face Inference API 集成进 Unity 项目,开发者可在 Unity 中调用 Hugging Face 的 AI 模型。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、处理 WikiText v1 数据集、生成 TFRecord 分片并上传至 Google Cloud Storage,以及最终模型训练与上传的完整流程。
Databricks 向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。以 16GB 数据集为例,处理时间从 22 分钟降至 12 分钟,提速超 40%。Databricks 还计划为 Spark 加入流式支持以进一步加快数据集加载。
Hugging Face 博客介绍如何用 diffusers 在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上运行 DeepFloyd 的 IF 文生图模型。
推荐理由:以免费 Colab 为约束,展示 8bit 量化与分阶段加载如何把 40GB 权重的 IF 跑起来,方法可迁移到其他大模型部署。
ChatGPT 用户现在可以关闭聊天记录,自行选择哪些对话可以被用于训练 OpenAI 的模型。
推荐理由:官方说明 ChatGPT 新增关闭聊天记录的能力,读者可据此了解对话数据是否用于模型训练的自主控制方式。
Hugging Face 上线中文博客 hf.co/blog/zh,由志愿者翻译 transformers、diffusion 和强化学习等博客与课程内容,面向不断壮大的中文 AI 社区。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,借助 optimum-neuron 无需切分或修改模型,一行代码即可编译。
Hugging Face 博客发布教程,演示如何用 Transformers 库(版本 >= 4.27.2)完成图分类任务,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示 Space,让用户体验数据孤岛下联邦学习的训练效果。联邦学习让数据留在本地、仅传输模型权重,用多源数据训练的模型在验证集上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等真实场景中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子活性数据集。
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞。该计划是 OpenAI 致力于开发安全、先进 AI 的一部分,目标是打造安全、可靠、可信的技术与服务。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoints 集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,可在客户需要时激活、不需要时休眠,从而控制成本。
OpenAI 阐述了其确保 AI 系统安全构建、部署和使用的方法,称这是其使命的关键。
Hugging Face 发布 StackLLaMA 模型并公开完整 RLHF 训练流程,涵盖监督微调、奖励建模和基于 PPO 的强化学习三个阶段,全部代码集成在 TRL 库中。
推荐理由:完整走通 SFT、奖励模型与 PPO 三段 RLHF 流程,并给出 8bit 加 LoRA 在单卡上复现的配置与踩坑记录。
Hugging Face 发布 Ethics and Society Newsletter #3,阐述其在开放 ML 中兼顾伦理的思路。平台推出 6 类伦理标签(严谨、知情同意、社会意识、可持续、包容、探究),并上线举报功能,供社区标记违规的模型、数据集或 Space。