Hugging Face 开源通用智能体 JAT:一个 Transformer 玩转 Atari、机器人控制与导航
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 是专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化,可生成包括官方文档与扩展在内的多种有效 DuckDB SQL 语句。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型统一接口,首个版本聚焦 3D 物体检测,输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用真实人类越狱提示词测试前沿模型的抗攻击能力,最终得分由 LlamaGuard 与 GPT-4 判定为 Safe 的提示词百分比构成。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类别评估 LLM 推理能力。
Hugging Face 博客演示了 PatchTST 时间序列模型的用法:先在 Electricity 数据集上训练并评估预测性能,再用该模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。
Hugging Face 发布 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 对多种 LLM 进行幻觉相关基准评测,覆盖闭卷问答、摘要、阅读理解、指令遵循、事实核查等任务,并已发布相关论文。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了轻量级时间序列建模方法 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch、通道和隐藏特征的轻量混合,可预训练后用于预测、分类和回归任务。
Vectara 基于 Hugging Face 开源的排行榜模板,发布了新的 HHEM 幻觉排行榜,用于评估 GPT-4、Gemini、Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持动态更新和社区提交新模型。Vectara 还公开了定制后的后端源码,可部署为 Hugging Face Space。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1(7.3B)三个模型,在灾难推文分类任务上评测性能,统一设置 MAX_LEN=512 以保证公平比较。
Hugging Face 复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感与描述性等风格任务上匹配了其学习曲线。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:在 Spaces 部署 AutoTrain 与 ChatUI 模板,用 Alpaca 指令数据集微调 Meta Llama 2 7b,再部署为可分享的聊天应用。训练 7b 模型建议选用 A10G Large GPU,AutoTrain 支持 FP16、Int4/8 量化与 PEFT 等设置。
3D Gaussian Splatting 是一种光栅化技术,能从少量图像样本中学习并实时渲染逼真场景。它先用 COLMAP 做 Structure from Motion 估计点云,再将每个点转为高斯并借助可微高斯光栅化训练,通过自动致密化与剪枝优化细节。
这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最后完成 UV 展开并导出 FBX 导入 Unity。整个流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题。
Hugging Face 与 Panel 达成合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成同时支持文本分类与特征提取 widget,并提供语言识别在线体验。
Hugging Face 博客介绍如何借鉴 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。
推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示 Space,让用户体验数据孤岛下联邦学习的训练效果。联邦学习让数据留在本地、仅传输模型权重,用多源数据训练的模型在验证集上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等真实场景中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子活性数据集。
AAAI21 最佳论文 Informer 现已加入 🤗 Transformers,可用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层的内存占用降至 O(N·T log T)。
Hugging Face 推出 🧨Diffusers for Mac 1.1,这款基于 Core ML 的原生应用将 Stable Diffusion 文生图速度最高提升至 2 倍,并自动为设备选择 GPU 或 Neural Engine 加速器。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行相对排名。该工具托管于 Spaces,由匹配算法、结果 Dataset 和展示 ELO 评分的 Leaderboard 组成,模型上传至 Hub 后即自动参与对战评估,起始 ELO 为 1200。
Mask2Former 和 OneFormer 两款图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 统一了实例、语义和全景分割三种任务,但需分别训练;OneFormer 仅需在全景数据集上训练一次即可在三种任务上达到 SOTA,精度更高但因额外文本编码器延迟更大。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型基于冻结的 CLIP 加 Transformer 解码器,在 PhraseCut 数据集(超 34 万条短语)上训练,支持文本或图像作为提示词,输出 352 x 352 像素的粗略分割掩码,可用于机器人感知、图像修复等任务,并可在 Segments.ai 上进一步精修。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上进行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并用 CLIP 文本编码器加解码器 Transformer 预测去噪隐变量分布。用户可通过 🧨 Diffusers 用几行代码加载 microsoft/vq-diffusion-ithq 并运行推理。
Hugging Face 与 arXiv 合作,将 Spaces 通过 arXivLabs 集成到论文页面,新增 Demo 标签页,可直接链接社区或作者创建的开源演示。自 2021 年 10 月上线以来,Spaces 已承载超过 12,000 个开源机器学习演示,基于 Gradio、Streamlit 等工具构建。以 BERT 论文为例,其 arXiv 页面可找到 200 多个相关演示。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),覆盖 8 类任务、56 个数据集、最多 112 种语言,排行榜已汇总超 2000 条结果。该基准通过 pip install mteb 即可对任意嵌入模型评测,并将结果提交至公开排行榜,方便按速度、性能与嵌入维度筛选模型。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 与 Intel Labs 等合作方发布少样本微调框架 SetFit,读者可了解其免提示词的两阶段训练思路与成本对比。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布新库 Skops,支持将 scikit-learn 模型托管到 Hugging Face Hub,并生成模型卡进行文档记录与协作。Skops 后端目前使用 joblib 加载模型,可自动填充库名、任务标识(如 tabular-classification)及推理 widget 所需元数据,并支持通过 add_metrics、add_plot 添加评估指标与图表。
Hugging Face 博客介绍了 Nyströmformer,一种用 Nyström 方法将标准自注意力 O(n²) 复杂度近似为 O(n) 的高效 Transformer 模型。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增端到端加载与处理示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 深度强化学习课程第 5 单元讲解策略梯度方法,并从头用 PyTorch 实现首个基于策略的算法 Reinforce,随后在 CartPole-v1、PixelCopter 和 Pong 上测试其鲁棒性。策略梯度直接优化策略、无需估计价值函数,可学习随机策略并省去手工的探索/利用权衡,更适合高维和连续动作空间,但易收敛到局部最优、训练更慢且方差较高。
Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 合作构建面向 Transformer 的硬件加速方案,覆盖训练、微调和推理。