OpenAI 发布 SWE-Lancer 基准
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准以真实外包项目为题目来源,衡量模型在实际软件工程工作中的变现能力。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准以真实外包项目为题目来源,衡量模型在实际软件工程工作中的变现能力。
OpenAI 与 Guardian Media Group 宣布达成内容合作,将 Guardian 的新闻内容引入 ChatGPT。
Fanatics Betting and Gaming 首席财务官 Andrea Ellis 分享了公司如何运用 AI 聚焦大局。这场对话围绕该博彩公司在业务中落地 AI 的思路展开。
Wayfair 首席技术官 Fiona Tan 分享了公司如何用 AI 塑造零售业的未来。这场对话围绕 Wayfair 在零售场景中的 AI 布局展开,具体模型、功能与数据未在原文中披露。
Rogo 借助 OpenAI o1 扩展 AI 驱动的金融研究。o1 的推理能力帮助该平台处理复杂金融分析任务。
OpenAI 与 Schibsted Media Group 宣布达成内容合作,将把《卫报》(Guardian)的新闻与历史档案内容引入 ChatGPT。
OpenAI 在超级碗投放了其首支电视广告,旨在激发人们对 AI 的好奇心。广告强调 AI 能为生活开启新可能、带来更多满足感并提升生产力,如同此前所有工具对人类的作用一样。
OpenAI 面向欧洲客户推出数据驻留功能,作为其企业级数据隐私、安全与合规体系的一部分。该功能支持全球客户,具体上线时间与适用模型未在原文中披露。
OpenAI 宣布与加州州立大学(CSU)系统合作,将 ChatGPT 带给 50 万名学生和教职员工,官方称这是迄今规模最大的一次 ChatGPT 部署。该合作旨在扩大 AI 在教育中的使用,并帮助美国培养具备 AI 能力的劳动力。
推荐理由:OpenAI 与加州州立大学系统合作,把 ChatGPT 覆盖到 50 万师生,是观察 AI 进校园规模的一个样本。
OpenAI 展示了用 ChatGPT 寻找美甲设计灵感的使用方式,用户可通过对话获取美甲创意。
OpenAI 分享了一则使用 ChatGPT 钓大比目鱼的用例。
OpenAI 介绍如何用 ChatGPT 构建自定义数学辅导老师,帮助用户按自己的节奏学习数学。该方案基于 ChatGPT 的个性化辅导能力,让学习者获得专属的数学学习支持。
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 的智能体框架,在 GAIA 验证集上取得 55.15% 的成绩,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的具体分数与代码智能体的对比数据。
OpenAI 发布 deep research,一个用推理综合大量在线信息、替用户完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方给出 deep research 的定位与开放节奏,可据此判断多步研究任务会怎样被智能体接手。
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该能力面向需要跨来源梳理信息的深度研究场景,帮助咨询团队分析复杂趋势。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 翻译消息,实施虚假评论招聘诈骗,要求受害者支付费用。
OpenAI 封禁了一批利用 AI 生成文章、帖子和虚假互动来干预加纳 2024 年总统选举的账号。该行动针对的是围绕这场选举的隐蔽影响力操作。
OpenAI 封禁了一批可能与公开报道的朝鲜(DPRK)关联威胁行为者有关的账号,这些账号利用 AI 研究入侵工具、钓鱼、恶意软件及加密货币攻击目标。
OpenAI 封禁了一批疑似源自中国的账号,这些账号利用 AI 生成英文社交帖子和西班牙语文章。相关行动被命名为“Sponsored Discontent”。
OpenAI 封禁了一批与伊朗有关联的账号,这些账号利用 AI 生成与 IUVM 和 STORM-2035 影响力活动相关的文章和社交帖子。相关活动跨平台展开。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译并生成恋爱与投资诈骗对话。此类"杀猪盘"骗局借助 AI 生成情感话术,用于实施浪漫诱饵式诈骗。
OpenAI 封禁了一批可能被用于协助欺诈性就业计划的账号,该计划带有公开报道过的朝鲜 IT 工作者活动的特征。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 起草监控工具推销方案、分析文档并调试代码。相关行动被命名为“同行评审”(Operation "Peer Review"),指向 AI 辅助监控规划。
OpenAI 发布 o3-mini 模型,官方页面已上线,但正文内容未能抓取,具体能力与参数暂不明确。
OpenAI 发布 o3-mini 系统卡,说明该模型开展的安全工作,涵盖安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness Framework 评测范围,可了解该模型上线前的安全审查构成。
OpenAI 最新一代推理模型将供美国国家实验室的顶尖科学家使用,以推动科学突破。该合作旨在加强美国在 AI 领域的领导地位。
OpenAI 发布 Operator 系统卡,说明其多层安全防护方案,包括针对提示词工程与越狱的模型和产品层缓解措施,以及隐私与安全保护。文档还披露了外部红队测试、安全评估结果,以及持续完善这些防护机制的后续工作。
总部位于德国的全球媒体、服务与教育公司 Bertelsmann 将把 OpenAI 的技术整合到其全球多个品牌中。
OpenAI 提出通过增加推理时计算来提升模型的对抗鲁棒性,即让模型在回答前进行更多思考。研究发现,随着推理时计算增加,模型对对抗性攻击的鲁棒性随之提升,但这一过程存在权衡。
OpenAI 发布 Stargate Infrastructure 表单,面向数据中心基础设施领域征集合作企业,覆盖电力、土地、建设到设备等环节。OpenAI 表示将与战略伙伴共同推进 AGI 基础设施建设,并希望与工业基础各环节公司建立合作。
推荐理由:OpenAI 公开征集数据中心基础设施合作方,可了解其 AGI 基建布局覆盖的环节。
OpenAI 官方发布公告,宣布 Stargate 项目。公告未提供更多细节,仅给出项目名称与发布动作。
推荐理由:OpenAI 官方宣布 Stargate 项目,读者可据此了解其自建 AI 基础设施的布局方向。
OpenAI 宣布与 Axios 建立合作,进一步扩大其在新闻行业的合作版图。目前已有代表数百家新闻编辑室和内容品牌的出版商通过 OpenAI 的合作与资助计划采用 AI 工具,ChatGPT 用户也可获取来自领先可靠出版物的信息。
Adebayo Ogunlesi 加入 OpenAI 董事会。Ogunlesi 是 Global Infrastructure Partners 的董事长兼首席执行官。
OpenAI 发文解释其结构必须演进,以推进自身使命,方向是让非营利组织更强大,并由营利性业务取得的成功来支撑。
OpenAI 为 o1 模型提出新的对齐策略 deliberative alignment,直接向模型教授安全规范并教其如何对这些规范进行推理。该策略面向 o1 系列模型,目标是提升语言模型的安全性。
推荐理由:OpenAI 公开 o1 模型的对齐策略,读者可了解其如何把安全规范直接教给模型并让其推理。
Artificial Analysis 发布 Big Bench Audio 评测数据集,用于评估音频语言模型的推理能力,该数据集将 Big Bench Hard 的 1000 道题改编为音频形式。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方公告仅给出上述要点,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性给出 o1 模型与 Realtime API、微调方法的更新,便于开发者对照现有集成评估升级点。
OpenAI 回应马斯克最新法律诉讼,称这是其不到一年内的第四次尝试。OpenAI 表示,马斯克 2017 年不仅想要、而且实际创建了营利性结构作为 OpenAI 当时提议的新架构。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户可导入自有素材进行扩展、重混和融合,也可完全由文本生成新内容。
推荐理由:OpenAI 官方给出 Sora 的开放入口与分辨率、时长、画幅等具体规格,便于读者判断可用范围。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora。Sora 支持文本、图像和视频输入,输出新生成的视频,并基于 DALL-E 与 GPT 系列模型的经验构建,用于拓展叙事与创意表达的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与模型来源,可了解其视频生成能力边界。