跳到正文
原文
Hugging Face Blog·· 2026-04-15AI 评分38

Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

AI 导读

Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。

来源:Hugging Face Blog · huggingface.co