Hugging Face Hub 改进 Jupyter Notebook 托管支持
Hugging Face 宣布改进 Hub 上 Jupyter Notebook 的托管支持,新增渲染功能,使原本为 JSON 格式的 ipynb 文件能以人类可读形式展示。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中直接打开。
Hugging Face 宣布改进 Hub 上 Jupyter Notebook 的托管支持,新增渲染功能,使原本为 JSON 格式的 ipynb 文件能以人类可读形式展示。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中直接打开。
OpenAI 发布题为 GPTs are GPTs 的研究,初步考察大语言模型对劳动力市场的潜在影响。材料仅提供标题,未包含正文内容。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解其能力定位。
冰岛正在使用 GPT-4 保护其语言。OpenAI 介绍了这一合作,旨在借助大模型技术应对冰岛语在数字时代面临的使用萎缩与传承压力。
GPT-4 被用于深化 Duolingo 的语言学习对话体验,以填补关键的语言学习空白。原文未披露具体功能细节、参数规模或可用性信息。
Be My Eyes 借助 GPT-4 改变视觉无障碍体验。该应用利用 GPT-4 为视障用户提供视觉辅助能力。
Stripe 利用 GPT-4 简化用户体验并打击欺诈。OpenAI 与 Stripe 合作,将 GPT-4 应用于其支付平台,以提升用户交互效率并加强反欺诈能力。
Khan Academy 正在一项有限试点项目中探索 GPT-4 用于虚拟课堂教育的潜力。该试点聚焦 GPT-4 在教学场景中的应用可能性。
OpenAI 发布 GPT-4,可用于创意与技术写作任务。它能在写歌、写剧本等场景中生成、编辑内容,并与用户反复迭代,还能学习用户的写作风格。
推荐理由:官方给出 GPT-4 在创意与技术写作上的生成、编辑与风格学习能力,可据此判断写作类任务的可用边界。
AAAI21 最佳论文 Informer 现已加入 🤗 Transformers,可用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层的内存占用降至 O(N·T log T)。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。方案结合 8-bit 矩阵乘法、低秩适配器和 peft 的 disable_adapters 机制,用同一份模型同时充当参考模型与活动模型,从而省去第二份模型副本。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到其他显存受限的训练场景。
Kakao Brain 与 Hugging Face 发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 把 ViT 与 ALIGN 连同训练数据一起开源,读者可据此判断视觉语言模型复现的门槛变化。
Hugging Face 在 Diffusers 中集成 ControlNet,推出 StableDiffusionControlNetPipeline,可用深度图、分割图、涂鸦、关键点等空间条件控制 Stable Diffusion 生成结果。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可直接照代码复现。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作搭建救灾应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随项目演进和社区反馈持续调整。准则涵盖透明、一致、简洁、可及、可复现与责任六项价值,同时列出 Community tab、Tag 功能、偏见探索 Space、Safe Stable Diffusion、Hub 分阶段发布及 OpenRAILs 许可等安全机制。
Witty Works 借助 Hugging Face Expert Acceleration Program,将写作助手的非包容性词汇检测从 spaCy 迁移到 Sentence Transformers 架构,并用 SetFit 实现少样本微调,每个词仅需 15-20 条标注句子。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(即比人类更聪明的 AI 系统)造福全人类。该文为 OpenAI 官方对 AGI 长期规划的表态,目前仅提供摘要。
红队测试通过构造自然语言提示词诱导 LLM 生成有害内容,从而暴露模型漏洞,与人类难以理解的对抗攻击不同。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。红队可由人工或另一个 LM 执行,角色扮演攻击和用代码作答能绕过经 RLHF 或 SFT 对齐的模型,该领域仍处早期,需要多机构协作共享数据集与最佳实践。
Hugging Face 推出 🧨Diffusers for Mac 1.1,这款基于 Core ML 的原生应用将 Stable Diffusion 文生图速度最高提升至 2 倍,并自动为设备选择 GPU 或 Neural Engine 加速器。
消费者奖励公司 Fetch 借助 AWS 合作伙伴 Hugging Face 的 Expert Acceleration Program,将原本依赖第三方黑盒的收据处理方案改为自研 AI/ML 模型,开发时间缩短 30%。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。Hugging Face 上已有超 10 万个免费模型,每日下载量超 100 万次,客户可在 SageMaker 和 EC2 上几次点击完成微调与部署。
OpenAI 正在澄清 ChatGPT 的行为是如何被塑造的,并公布改进计划:让用户拥有更多自定义空间,同时让公众更多地参与相关决策。
Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS、Azure(GCP 即将支持)等多种实例类型上。作者将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,用 RoBERTa 文本分类模型测试显示,large 实例延迟约 80ms,比原方案约 200ms 快一倍以上,但成本高出 24% 至 50%。
Hugging Face 发布指南,介绍 Salesforce Research 的 BLIP-2 视觉语言模型已集成到 Transformers,并演示图像描述、提示图像描述、视觉问答和对话式提示四种用法。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示描述、视觉问答和对话式提示四种用法,附可运行代码。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:官方给出 PEFT 库支持的微调方法与消费级硬件上的显存占用示例,便于判断低成本微调大模型的可行路径。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,官方权重发布在 Hugging Face Hub,并提供语音合成、音色转换和语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套架构覆盖 TTS、语音转换与 ASR,文中给出可直接运行的代码与权重入口,便于判断能否接入现有语音流程。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行相对排名。该工具托管于 Spaces,由匹配算法、结果 Dataset 和展示 ELO 评分的 Leaderboard 组成,模型上传至 Hub 后即自动参与对战评估,起始 ELO 为 1200。
Hugging Face 的 AI for Game Development 系列教程第五篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,再通过多轮对话要求其更具原创性并去除魔法元素,最后生成游戏与商店物品描述。
Hugging Face 在 Ice Lake 与 Sapphire Rapids 两种 Amazon EC2 实例上对比了 distilbert-base-uncased、bert-base-uncased 和 roberta-base 的推理性能,测试 16 与 128 token 句子的单条及批量预测延迟。
Hugging Face 发布博客深入解析视觉语言模型的训练方法,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练策略。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验该领域最新进展。
Hugging Face 公布其计算机视觉生态现状:Hub 上已支持 8 个核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖图像分类、分割、目标检测、深度估计等,并兼容 ViT、Swin、DETR 及 ConvNeXt、ResNet 等架构。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏素材,并以农场游戏的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式加入 LoRA 微调支持,覆盖 Dreambooth 和完整微调两种方式,训练脚本最低可在 11 GB 显存上运行。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,可据此在 11 GB 显存上复现。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为热门 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)提示和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、训练数据、模型架构与评测方向上的差异。
OpenAI 宣布与 Microsoft 延长双方的合作关系。该消息由 OpenAI 官方发布,未披露合作延长的具体条款、期限或范围。
推荐理由:OpenAI 官方宣布与 Microsoft 延长合作,可据此了解双方既有合作关系的延续动向。
Hugging Face 博客"AI for Game Development"系列第 3 天聚焦 3D 资产生成,结论是 text-to-3D 目前还无法实际用于游戏开发。
Mask2Former 和 OneFormer 两款图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 统一了实例、语义和全景分割三种任务,但需分别训练;OneFormer 仅需在全景数据集上训练一次即可在三种任务上达到 SOTA,精度更高但因额外文本编码器延迟更大。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 与百度飞桨(PaddlePaddle)达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub,首批已有超 75 个模型上线,涵盖 UIE、ERNIE 3.0、Ernie-Layout 等。
Hugging Face 发布教程,演示如何用 🤗 Transformers 和 Datasets 库构建图像相似度检索系统。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配查询图像与候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。
最多提供 50 页,更早的内容请使用搜索或主题页。