Hugging Face 发布 smolagents:用代码编写动作的简单智能体库
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即用代码而非 JSON 编写动作的智能体,同时保留写 JSON 的 ToolCallingAgent。
推荐理由:官方给出 CodeAgent 的定位与代码示例,读者可据此判断代码式动作与 JSON 工具调用的差异。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即用代码而非 JSON 编写动作的智能体,同时保留写 JSON 的 ToolCallingAgent。
推荐理由:官方给出 CodeAgent 的定位与代码示例,读者可据此判断代码式动作与 JSON 工具调用的差异。
Mistral AI 为免费生成式 AI 助手 le Chat 推出一批 beta 功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词流程的智能体。
推荐理由:官方一次性列出 le Chat 的联网搜索、Canvas、文档图像理解与智能体等能力,并给出与主流助手的逐项对比。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,可作为部署选型的参考。
Hugging Face 用 transformers.agents 构建的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集为 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:官方披露 Code Agent 在 GAIA 上的成绩与实现细节,可看到代码动作与多智能体编排的具体做法。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增两类可基于历史观察迭代的智能体,并加入共享功能。官方称新框架下 Llama-3-70B-Instruct 智能体在 GAIA 榜单上超过多个基于 GPT-4 的智能体,排名第 4,成为开源类别领先者。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,可了解其模型接入方式与自部署、审核机制。
Hugging Face 在 LangChain 的 ReAct 实现中评测了 Llama2-70b-chat、Mixtral-8x7B-Instruct-v0.1、OpenHermes-2.5-Mistral-7B、Zephyr-7b-beta、SOLAR-10.7B-Instruct-v1.0 等开源模型作为通用推理智能体的表现,并与 GPT-3.5、GPT-4 对比。
推荐理由:用同一套 ReAct 基准横向对比多个开源模型与 GPT-3.5、GPT-4,并给出 LangChain 搭建代码,可据此判断开源模型做智能体的可用性。
OpenAI 宣布 ChatGPT 已实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或调用第三方服务。
推荐理由:OpenAI 官方给出插件机制的最初定义,可据此了解 ChatGPT 接入外部工具与实时信息的早期形态。
OpenAI 提出 Video PreTraining(VPT),在大量无标注的人类 Minecraft 游戏视频上训练神经网络,仅使用少量标注的承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动的原生人类接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注人类游戏视频预训练网络,展示从少量标注数据到通用计算机操作智能体的路径。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未预设支持的。OpenAI 表示,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负,但在两局的前 20–35 分钟都保持了较高的取胜机会。
OpenAI 宣布由五个神经网络组成的 OpenAI Five 已开始击败 Dota 2 业余人类队伍。该团队由五个神经网络构成,此次披露仅给出这一结果,未提供更多技术细节。
推荐理由:OpenAI 官方披露五个神经网络组成的 OpenAI Five 已能击败 Dota 2 业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 训练出一个机器人,在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该机器人完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出的机器人击败 Dota 2 顶级职业选手,展示了在复杂对抗环境中达成目标的一种路径。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台。该平台覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 官方发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。