Hugging Face Blog·· 2024-02-23AI 评分36
Haize Labs 联合 Hugging Face 推出红队抵抗排行榜
Introducing the Red-Teaming Resistance Leaderboard
AI 导读
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用真实人类越狱提示词测试前沿模型的抗攻击能力,最终得分由 LlamaGuard 与 GPT-4 判定为 Safe 的提示词百分比构成。
来源:Hugging Face Blog · huggingface.co