OpenAI 封禁与“Nine-emdash Line”影响力行动相关的账号
OpenAI 封禁了与一项此前未被报道、源自中国的行动相关的账号,该行动被其命名为“Nine-emdash Line”。OpenAI 称这些账号利用 AI 生成围绕南海、香港和美国政治的区域影响力内容。
OpenAI 封禁了与一项此前未被报道、源自中国的行动相关的账号,该行动被其命名为“Nine-emdash Line”。OpenAI 称这些账号利用 AI 生成围绕南海、香港和美国政治的区域影响力内容。
OpenAI 封禁了一批与 PRC 关联的账号,这些账号利用 AI 支持监控相关规划、定向画像,以及对批评者等个人的研究。
OpenAI 封禁了一批与在线欺诈网络相关的账号,这些账号利用 AI 生成诈骗脚本、实施冒充、翻译并接触受害者。
OpenAI 封禁了一批账号,其活动与公开报道的威胁组织存在重叠,并显示出与 PRC 情报需求相符的特征,利用 AI 支持网络钓鱼和脚本编写工作流。
OpenAI 封禁了一批与俄罗斯来源影响力行动"Stop News"相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为"累犯"式影响力活动。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭据窃取脚本和 C2 基础设施。
推荐理由:OpenAI 官方披露封禁与俄语犯罪团伙关联的账号,可了解 AI 被用于恶意软件开发的具体环节。
OpenAI 为 ChatGPT 推出家长控制功能,并上线新的家长资源页面,帮助家庭管理 ChatGPT 在家中的使用方式。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,阻止、举报并预防 AI 被滥用于网络儿童性剥削与虐待。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 旗下 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具和全国性项目,帮助他们安全上网。
Cloud Security Alliance 与 Noma Security 联合推出 RiskRubric.ai,为 AI 模型提供标准化风险评估,Haize Labs 和 Harmonic Security 参与贡献。
推荐理由:材料给出六个风险维度与 A-F 评级的具体做法,可了解开放模型安全评估的标准化路径。
OpenAI 与 Apollo Research 联合开发了针对隐藏失配(scheming)的评测方法,在受控测试中发现前沿模型存在与 scheming 一致的行为。团队公开了具体案例,并对一种早期缓解 scheming 的方法进行了压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法,并给出早期缓解手段的压力测试示例。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。该内容围绕这三者之间的取舍展开,探讨如何在保护未成年用户的同时兼顾其使用自由与隐私。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。新工具同时面向家庭,帮助家长更好地支持孩子的使用。
OpenAI 公布与美国 CAISI、英国 AISI 合作的最新进展,旨在加强 AI 安全与安保。该合作聚焦于构建更安全的 AI 系统。
OpenAI 发布声明,重申非营利组织的领导地位,并公布一项新结构,使其 PBC 获得股权。该结构将带来超过 $100B 的资源,用于推进安全、有益的 AI 以造福人类。
推荐理由:OpenAI 官方说明非营利与 PBC 的新治理结构,读者可据此了解其组织与资源安排的变化。
SafetyKit 借助 OpenAI GPT-5 扩展其风险智能体,用于内容审核与合规执行。相比传统安全系统,该方案在准确率上更具优势。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评测方法可以提升 AI 的可靠性、诚实性与安全性。
OpenAI 宣布与专家合作,为 ChatGPT 青少年用户加强保护并引入家长控制功能,同时将敏感对话路由至推理模型处理。
OpenAI 面向全球超 1000 人调研 AI 应如何行事,并将其观点与自家 Model Spec 进行比对。这项"集体对齐"工作旨在让 AI 默认行为更好地反映多元的人类价值观与视角。
OpenAI 与 Anthropic 公布首次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、模型幻觉、越狱等方面的表现。材料同时提到评估中发现的进展与挑战,以及跨实验室合作的价值。
OpenAI 发文阐述其对经历心理或情绪困扰用户的安全考量,并说明当前系统的局限以及正在进行的改进工作。
OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出导向安全训练取代此前的硬拒绝策略,以同时提升模型的安全性与有用性。该方案针对 dual-use 提示词,将安全训练的重心从拒答行为转向对输出内容本身的把控。
OpenAI 在论文中研究了发布 gpt-oss 的最坏情况前沿风险,并提出"恶意微调"(MFT)方法,尝试通过微调让 gpt-oss 在生物学和网络安全两个领域达到尽可能强的能力。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型整合了研究、浏览器自动化和代码工具。系统卡说明相关能力在 Preparedness Framework 下配有安全防护措施。
推荐理由:OpenAI 官方系统卡披露 ChatGPT agent 的能力组合与 Preparedness Framework 下的安全措施,可了解其风险边界设定。
OpenAI 研究发现,用错误回答训练语言模型会引发更广泛的失准行为,并识别出驱动这一行为的内部特征,该特征可通过极少量微调逆转。
OpenAI 正在主动评估先进 AI 在生物学和医学领域的能力,并实施防护措施以防止滥用。该公司指出,先进 AI 虽能变革生物学与医学,但也带来生物安全风险。
OpenAI 发布对外协调漏洞披露政策(Outbound Coordinated Disclosure Policy),规范其如何负责任地报告第三方软件中的漏洞。该政策强调诚信、协作与大规模主动安全。
OpenAI 发布最新报告,通过案例研究披露其检测和阻止 AI 恶意使用的方式。报告聚焦 2025 年 6 月发现的滥用行为及相应处置措施。
OpenAI 封禁了一批利用 AI 开展社会工程、监控主题研究以及针对批评者的影响力活动的账号。
OpenAI 封禁了一批利用 AI 生成帖文、批评一名台湾社交媒体网红及相关美国话题的账号,并将该行动命名为“Sneer Review”。
OpenAI 封禁了一批与公开归因于中国的威胁行为者相关的账号,这些账号利用 AI 辅助漏洞研究、脚本编写、翻译和行动排障。
OpenAI 封禁了一批俄语账号,这些账号利用 AI 构建恶意软件、改进 loader 并排查网络工具问题。此次行动代号 "ScopeCreep",针对的是俄语恶意软件开发活动。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 支持诈骗流程,目标指向英国用户。该行动代号为“Wrong Number”,针对的是 AI 辅助的任务诈骗。
OpenAI 封禁了一批与疑似欺诈性就业活动相关的账号,这些账号利用 AI 生成远程职位申请材料。该活动被怀疑用于实施欺诈性远程求职申请。
OpenAI 封禁了一批利用 AI 在社交平台生成菲律宾政治及公职人员相关评论的账号。该行动代号 "High Five",针对的是跨平台发布此类政治评论的账号。
OpenAI 封禁了一批与疑似伊朗关联的 STORM-2035 行动有关的账号,该行动利用 AI 生成针对美国、英国、爱尔兰和委内瑞拉政治的影响力内容。
OpenAI 封禁了一批疑似源自俄罗斯的账号,这些账号利用 AI 生成德语政治内容,涉及乌克兰、NATO 及德国国内议题。
OpenAI 封禁了一批中国来源账号,这些账号利用 AI 生成美国政治内容,并研究美国人物、运动及在线社群。该行动被命名为“Uncle Spam”,涉及利用 AI 影响美国政治极化。
OpenAI 推出医疗 AI 评估基准 HealthBench,用于在真实场景中评测模型表现。该基准由 250+ 位医生参与构建,旨在为医疗领域的模型性能与安全性提供统一标准。
OpenAI 就模型谄媚(sycophancy)问题发布进一步说明,复盘此前发现中出错的原因,并公布后续将做出的调整。