热点事件持续更新
Aleph Alpha 测中国模型敏感话题表现
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
2026年10月4日,The Decoder 报道了 Aleph Alpha 的一项研究。该研究开发了一套基准测试,用于评估阿里千问、DeepSeek 和月之暗面 Kimi 的模型,测试覆盖天安门、台湾、新疆等 967 个敏感话题。Aleph Alpha 自研的评分系统判定,这些模型仅 17% 至 41% 的回答算平衡,其余回答则复述官方立场、回避或拒答。目前事件进展仅此一篇报道,尚无后续更新。
AI 根据报道生成 · 9 小时前更新
最新进展10月4日 16:47
Aleph Alpha 研究称中国模型敏感话题回答仅17%至41%算平衡。报道时间线
沿着报道,了解事件的不同侧面。
10月4日
- The DecoderAleph Alpha 研究:中国模型在敏感话题上复述官方立场或拒答
Aleph Alpha 开发基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。