OpenAI 封禁疑似源自柬埔寨的 AI 诈骗账号,目标为印尼交友用户
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动被命名为“Date Bait”。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动被命名为“Date Bait”。
OpenAI 封禁了一批与代号“No Bell”行动相关的账号,该行动疑似源自俄罗斯,此前未被报道。这些账号利用 AI 面向非洲受众生成批评美国及其盟友的内容。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点及社会工程学手法。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助在 AI 时代推进青少年安全与福祉的非政府组织和研究人员。
OpenAI 说明了 AI 智能体打开链接时如何保护用户数据,通过内置防护机制防止基于 URL 的数据外泄和提示词注入。
ChatGPT 正在推出年龄预测功能,用于判断账号用户是否年满 18 岁,并对青少年账号应用相应保护措施。OpenAI 表示该功能的准确性将随时间推移持续优化。
ServiceNow 发布 AprielGuard,一个 8B 参数的安全与安全防护模型,可检测 16 类安全风险以及提示词注入、越狱、思维链污染、上下文劫持、记忆投毒和多智能体攻击序列等对抗攻击。
OpenAI 推出面向思维链可监控性的新框架与评测套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,并明确了模型在更高风险情境下的预期行为,是其改善 ChatGPT 青少年安全整体工作的一部分。
OpenAI 发布面向青少年与家长的 AI 素养资源,帮助其更审慎、安全且有信心地使用 ChatGPT。指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持青少年应对情绪或敏感话题。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAE)与 transcoder 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供 SAE 与 transcoder,读者可据此了解模型可解释性工具的开源进展。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 在湿实验室中加速生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的前景与风险。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并联合发布报告,重点研究 CoT 监控、社会情感错位影响以及 AI 对经济系统的冲击。Google DeepMind 称 Gemini 3 是其迄今最智能、最安全的模型。
OpenAI 更新 GPT-5 系统卡,将 GPT-5.2 纳入其中。GPT-5.2 是 GPT-5 系列的最新模型家族,其安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡所述基本一致。这些模型与 OpenAI 其他模型一样,训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:官方系统卡更新披露 GPT-5.2 的安全缓解思路与 GPT-5 系列保持一致,可对照前代系统卡了解其安全策略延续性。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在人工评估中最高有 70% 的情况更受 LLM 评审青睐,但隐私预算收紧时主题覆盖度会下降。
OpenAI 正在针对 AI 模型网络安全能力增强的趋势,投入更强的防护措施与防御能力。公司说明了其评估风险、限制滥用的方式,并与安全社区合作提升网络韧性。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。
OpenAI 拨款最高 200 万美元,资助 AI 与心理健康交叉领域的研究。该计划支持研究现实世界中的风险、收益与应用,以提升安全性和福祉。
OpenAI 披露一起涉及 Mixpanel 的安全事件,波及有限的 API 分析数据,但 API 内容、凭证和支付信息均未泄露。OpenAI 同时说明了事件经过及正在采取的用户保护措施。
OpenAI 与独立专家合作评估前沿 AI 系统,借助第三方测试强化安全保障、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明该模型在模型层与产品层部署的安全措施。模型层包括针对有害任务和提示词注入的专项安全训练,产品层则涵盖智能体沙箱与可配置网络访问。
OpenAI 正在探索机制可解释性,以理解神经网络如何进行推理。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法。
OpenAI 发布 GPT-5 系统卡补充说明,给出 GPT-5.1 Instant 与 GPT-5.1 Thinking 的更新安全指标,并新增心理健康与情感依赖方面的评估。
推荐理由:官方补充卡给出 GPT-5.1 两个版本的安全指标更新,并新增心理健康与情感依赖评估。
OpenAI 发文解析提示词注入这一 AI 系统面临的前沿安全挑战,说明此类攻击的运作方式,并介绍其在研究、模型训练和用户防护措施上的推进方向。
OpenAI 发文指出 AI 正在快速进步,人类有机会塑造其发展方向,使其走向科学发现、安全以及惠及所有人的更好未来。
OpenAI 发布青少年安全蓝图,为负责任地构建 AI 提供路线图,涵盖安全防护、适龄设计与多方协作。该蓝图旨在保护并赋能年轻人在线使用 AI。
OpenAI 推出 AI 安全研究员 Aardvark,可自主发现、验证并协助修复大规模软件漏洞。该系统目前处于 private beta 阶段,可报名参与早期测试。
Google Research 提出可证明隐私洞察(PPI),结合大语言模型、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析非结构化 GenAI 数据。
推荐理由:Google 把 LLM、差分隐私与 TEE 组合成可外部核验的隐私分析流程,读者可了解端侧 AI 数据如何在不暴露个体数据的前提下被统计。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型。二者基于 gpt-oss 模型后训练,能依据给定策略进行推理并对内容打标,报告同时给出以原 gpt-oss 模型为基线的安全评估结果。
OpenAI 发布 gpt-oss-safeguard,这是一组用于安全分类的开放权重推理模型。开发者可以基于它应用并迭代自定义策略。
Doppel 借助 GPT-5 和强化微调拦截深度伪造与冒充攻击,将分析师工作量削减 80%,响应时间从数小时缩短至数分钟。该防御系统可在攻击扩散前完成阻断。
Hugging Face 提出“语音同意门”机制,让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆。该方案用语言模型为每次授权生成一对全新句子,一句表达明确同意并包含模型名,另一句提供语音多样性,从而支持可追溯、可审计的授权流程。官方同时发布了示例 Space 和配套代码。
OpenAI 发布 GPT-5 系统卡补充文件,说明 GPT-5 在处理敏感对话方面的改进。补充内容包含情绪依赖、心理健康和越狱抵抗三项新基准。
OpenAI 与 170 多位心理健康专家合作,改进 ChatGPT 识别痛苦情绪、共情回应并引导用户寻求现实支持的能力,使不安全回应最多减少 80%。OpenAI 表示此举旨在让 ChatGPT 在敏感时刻更安全、更具支持性。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,从即日起对 Hub 上 220 万以上公开模型和数据集仓库进行持续扫描。
OpenAI 成立"福祉与 AI 专家委员会",汇集心理学家、临床医生与研究人员,为 ChatGPT 如何支持情绪健康提供指导,尤其针对青少年群体。该委员会的意见将用于塑造更安全、更具关怀的 AI 体验。
OpenAI 公布了一套面向 ChatGPT 政治偏见的新评估方法,采用更贴近真实场景的测试方式来提升客观性并减少偏见。该方法试图为 LLM 政治偏见的定义与衡量提供更可验证的标准。
OpenAI 发布 2025 年 10 月报告,披露其识别和阻断 AI 恶意使用的进展。报告介绍了 OpenAI 如何打击滥用行为、执行政策,并保护用户免受现实危害。
OpenAI 封禁了一批韩语账户,这些账户利用 AI 进行恶意软件开发支持、调试、钓鱼和凭据窃取。