Hugging Face 发布 smolagents:用代码编写动作的简单智能体库
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即用代码而非 JSON 编写动作的智能体,同时保留写 JSON 的 ToolCallingAgent。
推荐理由:官方给出 CodeAgent 的定位与代码示例,读者可据此判断代码式动作与 JSON 工具调用的差异。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即用代码而非 JSON 编写动作的智能体,同时保留写 JSON 的 ToolCallingAgent。
推荐理由:官方给出 CodeAgent 的定位与代码示例,读者可据此判断代码式动作与 JSON 工具调用的差异。
Mistral AI 为免费生成式 AI 助手 le Chat 推出一批 beta 功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词流程的智能体。
推荐理由:官方一次性列出 le Chat 的联网搜索、Canvas、文档图像理解与智能体等能力,并给出与主流助手的逐项对比。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准聚焦智能体完成机器学习工程的能力评估。
Altera 基于 GPT-4o 构建智能体与人类协作的新领域。该方向聚焦 agent 与人的协同交互,而非单纯自动化。
Mercado Libre 推出 AI 开发平台 Verdi,由 GPT-4o 驱动。该平台面向开发者,具体功能与可用性细节尚未披露。
Mistral AI 宣布在 La Plateforme 上支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行定制,可通过 base prompt、few-shot prompting 或微调实现,并支持自带数据集。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,可作为部署选型的参考。
Hugging Face 用 transformers.agents 构建的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集为 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:官方披露 Code Agent 在 GAIA 上的成绩与实现细节,可看到代码动作与多智能体编排的具体做法。
Hugging Face 上线 NPC-Playground,一个由 Cubzh 与 Gigax 打造的 3D 演示,可在浏览器中与 LLM 驱动的 NPC 对话,并用几行 Lua 脚本教它们新技能。
MavenAGI 推出基于 GPT-4 的 AI 客服智能体,Tripadvisor、Clickup 和 Rho 等公司已在使用,以节省时间并更好地服务客户。
Hugging Face 与 LangChain 联合发布合作包 langchain_huggingface,可通过 pip install langchain-huggingface 安装,将 Hugging Face 最新能力同步进 LangChain 生态。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增两类可基于历史观察迭代的智能体,并加入共享功能。官方称新框架下 Llama-3-70B-Instruct 智能体在 GAIA 榜单上超过多个基于 GPT-4 的智能体,排名第 4,成为开源类别领先者。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Klarna 的 AI 助手承担了相当于 700 名全职客服的工作量,用于革新个性化购物、客户服务与员工生产力。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,可了解其模型接入方式与自部署、审核机制。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,内置若干多模态工具并支持自定义工具与模型。
OpenAI 宣布 ChatGPT 已实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或调用第三方服务。
推荐理由:OpenAI 官方给出插件机制的最初定义,可据此了解 ChatGPT 接入外部工具与实时信息的早期形态。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行相对排名。该工具托管于 Spaces,由匹配算法、结果 Dataset 和展示 ELO 评分的 Leaderboard 组成,模型上传至 Hub 后即自动参与对战评估,起始 ELO 为 1200。
Hugging Face 的 AI for Game Development 系列教程第五篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,再通过多轮对话要求其更具原创性并去除魔法元素,最后生成游戏与商店物品描述。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
Hugging Face 发布首个自定义深度强化学习环境 Snowball Fight 1vs1,玩家可在 Hugging Face Spaces 上在线与深度强化学习智能体对战扔雪球。该环境基于 Unity ML-Agents 构建并已开源托管于 Hugging Face Hub,后续还将推出 2vs2 版本,用 MA-POCA 算法训练智能体团队协作。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向在训练过程中兼顾安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式的任务中容纳数量可变的大量智能体。该平台引入多个智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的能力,并已帮助厘清强化学习领域一个长期存在的难题。该环境在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但仍对当前最先进算法构成值得挑战的泛化测试。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负,但在两局的前 20–35 分钟都保持了较高的取胜机会。
OpenAI 宣布由五个神经网络组成的 OpenAI Five 已开始击败 Dota 2 业余人类队伍。该团队由五个神经网络构成,此次披露仅给出这一结果,未提供更多技术细节。
推荐理由:OpenAI 官方披露五个神经网络组成的 OpenAI Five 已能击败 Dota 2 业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 首届 Retro Contest 已完成,该比赛探索能从前序经验中泛化的算法。
OpenAI 开发出一种分层强化学习算法,能学习对解决多类任务有用的高层动作,从而快速求解需要数千个时间步的任务。在导航问题集上,该算法发现了向不同方向行走和爬行的高层动作,使智能体能够快速掌握新的导航任务。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法考虑到其他智能体也在学习,能在迭代囚徒困境中发现“tit-for-tat”这类既自利又合作的策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。
OpenAI 发文指出,智能体争夺资源的多智能体环境是通往 AGI 的踏脚石,其难度由竞争对手的水平决定,与自身克隆体对抗时环境恰好匹配自身能力。这类环境不存在稳定均衡,智能体再聪明也始终面临变得更聪明的压力,因此与传统环境体验迥异,仍需大量研究才能驾驭。
OpenAI 发布一项新研究,介绍智能体在其中发展出自己的语言。该文为 OpenAI 官方博客文章,正文仅提供摘要,未给出具体方法、实验设置或结果细节。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台。该平台覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 官方发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。