OpenAI o1 如何应对复杂经济学问题
经济学家 Tyler Cowen 解读 OpenAI o1 如何解答复杂的经济学问题。该模型通过推理能力处理经济领域的复杂提问。
经济学家 Tyler Cowen 解读 OpenAI o1 如何解答复杂的经济学问题。该模型通过推理能力处理经济领域的复杂提问。
量子物理学家 Mario Krenn 使用 OpenAI o1 帮助回答生命中最重大的问题。该模型被用于回应量子物理领域的疑问。
遗传学家 Catherine Brownstein 展示了 OpenAI o1 如何加速罕见医学难题的诊断流程。该演示聚焦于将 o1 用于基因数据分析,以缩短罕见病的诊断周期。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,这是首个通用大规模纯 Mamba 模型,采用 TII Falcon Mamba 7B License 1.0 开放获取,已在 Hugging Face 生态上线。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,并给出与同规模 Transformer 的基准对比和长序列内存数据。
Mistral AI 发布 Mistral Large 2,模型规模 123B 参数,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上预训练版本准确率达 84.0%,代码与推理表现大幅超过上一代 Mistral Large,并与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当。
推荐理由:Mistral Large 2 以 123B 参数实现单节点推理,并给出与 GPT-4o、Claude 3 Opus、Llama 3 405B 的同管线对比数据。
Mistral AI 发布基于 Mistral 7B 的数学推理模型 Mathstral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%,在同规模模型中达到 SOTA。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集 50 题中解出 29 题。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛与模型训练。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此 Hugging Face 与 .txt 合作,尝试用结构化生成库 Outlines 约束模型输出,以降低提示词格式带来的评测方差。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,采用 Classic 与 Reflect 两种提示策略生成推理链,并称对训练数据污染更具鲁棒性。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器与 8K 上下文带来的变化。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅激活 39B,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准表现,可据此判断其成本与能力定位。
Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出旗舰模型 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其能力定位与接入方式。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类别评估 LLM 推理能力。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。
Mistral 发布 Mixtral 8x7B,采用 Mixture of Experts 架构,8 个专家模型每个时间步激活 2 个,总参数量约 45B,支持 32k token 上下文,在多数基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:文章给出 Mixtral 8x7B 的架构说明、基准对比与 Hugging Face 全套集成方式,便于判断开源 MoE 模型的可用性。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改成 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒。
推荐理由:官方给出单行代码替换即可提速的量化数据与 FP8 支持范围,便于判断迁移成本。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 为例演示。
Mistral AI 发布 7.3B 参数语言模型 Mistral 7B,采用 Apache 2.0 许可,可无限制使用,并提供了参考实现、vLLM 推理服务器、Skypilot 及 HuggingFace 等使用方式。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并给出 Apache 2.0 许可与本地、云端部署路径。
Hugging Face 博客梳理了生产环境部署 LLM 的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Meta 发布 Llama 2 系列开放大语言模型,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可,代码、预训练模型和微调模型同日放出。
推荐理由:Meta 开放 Llama 2 商用许可,Hugging Face 同步给出推理、量化与微调的完整接入路径。
Hugging Face 用实验反驳了 AAAI 2023 论文《Are Transformers Effective for Time Series Forecasting?
OpenAI 训练了一个模型,通过奖励每一步正确推理(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督提升数学推理,并说明其对思维链对齐的作用。
Hugging Face 博客介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优点,并已被集成进 transformers 库。
推荐理由:文章解释了 RWKV 如何把 RNN 的推理效率与 Transformer 的并行训练结合,并给出可直接运行的代码示例。
Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。
推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。
Hugging Face 发布 BLOOMZ 在 Habana Gaudi2 上的推理基准,176B 参数版本延迟 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 延迟 0.734 秒,比 A100 快 2.89 倍。
AAAI21 最佳论文 Informer 现已加入 🤗 Transformers,可用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层的内存占用降至 O(N·T log T)。
Hugging Face 在 Ice Lake 与 Sapphire Rapids 两种 Amazon EC2 实例上对比了 distilbert-base-uncased、bert-base-uncased 和 roberta-base 的推理性能,测试 16 与 128 token 句子的单条及批量预测延迟。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)提示和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、训练数据、模型架构与评测方向上的差异。
Hugging Face 博客图解 RLHF 的完整流程,将其拆为预训练语言模型、收集人类偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了 TRL、TRLX、RL4LMs 等开源工具与主要论文,便于建立整体认识。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 模型完成单变量概率时间序列预测。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型可在更少 GPU 上运行且性能不降。
推荐理由:Hugging Face 与 BigScience 作者复盘 LLM.int8() 接入 transformers 的工程细节,可看到大模型量化落地的真实难点。
Hugging Face 博客介绍了 Nyströmformer,一种用 Nyström 方法将标准自注意力 O(n²) 复杂度近似为 O(n) 的高效 Transformer 模型。
Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C),一种结合基于策略与基于价值方法的混合架构,通过 Critic 评估动作价值来降低 Reinforce 中蒙特卡洛采样带来的高方差,从而稳定并加速训练。课程使用 Stable-Baselines3 在 PyBullet 机器人环境中训练双足步行者和蜘蛛两个智能体行走。
Hugging Face 发布 Twitter 情感分析入门指南,面向开发者和非开发者分别给出方案。开发者可用 Tweepy 抓取推文并通过 Inference API 几行代码完成情感分类,非开发者则可借助无代码工具 Zapier 将推文分析结果写入 Google Sheets。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning,用神经网络替代 Q-table 来近似各动作的 Q-value,并训练智能体玩 Space Invaders 等 Atari 环境。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个面向 Gym 连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
Hugging Face 在 🤗 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数让用户指定生成结果中必须包含的词。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够求解多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的问题。
推荐理由:OpenAI 用神经网络定理证明器在 Lean 中求解 AMC12、AIME 及两道 IMO 改编题,可了解形式化数学推理的早期进展。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。该系统解出的题目数量约为真实儿童的 90%:在一组来自其数据集的测试题上,9-12 岁儿童小样本得分 60%,该系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比自家系统与微调 GPT-3 及 9-12 岁儿童的成绩,可看推理能力当时的水平参照。