OpenAI 宣布设立日本办公室,并发布日语优化的 GPT-4 定制模型
OpenAI 宣布在亚洲设立首个办公室,落地日本,同时发布一款针对日语优化的 GPT-4 定制模型。
OpenAI 宣布在亚洲设立首个办公室,落地日本,同时发布一款针对日语优化的 GPT-4 定制模型。
Hugging Face 发布视觉语言模型入门指南,梳理其核心架构由图像编码器、嵌入投影器和文本解码器组成,并盘点 LLaVA 1.6、CogVLM、Qwen-VL、Yi-VL-34B 等开源模型。文章还介绍了 Vision Arena、Open VLM Leaderboard 等评测榜单及 MMMU、MMBench 等基准,并演示如何用新版 trl 微调这类模型。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账号,并作为 API Endpoint 运行。
Google 发布代码专用开源模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint 继续训练,额外使用 5000 亿 token 的英文、数学和代码数据,共三个版本:2B 基础模型专注代码填充,7B 基础模型混合代码填充与自然语言,7B Instruct 面向代码对话。
推荐理由:Google 开源代码专用模型 CodeGemma 的三个版本与 Hugging Face 生态集成细节,可据此判断代码补全场景的选型。
Klarna 的 AI 助手承担了相当于 700 名全职客服的工作量,用于革新个性化购物、客户服务与员工生产力。
OpenAI 为微调 API 增加新功能,让开发者对微调拥有更多控制权,同时公布构建自定义模型的新方式。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 是专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化,可生成包括官方文档与扩展在内的多种有效 DuckDB SQL 语句。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台的安全缺陷,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Harvey 与 OpenAI 合作构建了一款面向法律从业者的定制训练模型。该模型基于 OpenAI 技术进行定制训练,具体参数与可用性细节未披露。
Hugging Face Hub 上线 "Deploy on Cloudflare Workers AI" 集成,让开发者以无服务器 API 方式调用 Llama、Gemma、Mistral 等热门开源模型,由 Cloudflare 边缘数据中心的 GPU 和 Text Generation Inference 驱动,按请求计费、无需自管 GPU。
Oscar 将 AI 引入医疗保险业务,用于降低成本和改善患者护理。该举措旨在减少保险开支并提升护理质量。
OpenAI 分享了自定义语音生成模型 Voice Engine 小规模预览的经验教训。该模型可根据声音样本创建定制语音,OpenAI 同时探讨了合成语音带来的挑战与机遇。
Zelma 借助 GPT-4 让教育数据变得易于获取。
OpenAI 上月发布 Sora 后,与艺术家合作探索该视频生成模型如何辅助创作流程,并公布首批使用反馈。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型统一接口,首个版本聚焦 3D 物体检测,输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 发布面向非技术读者的 Transformers 入门指南,从零解释这一开源 Python 库、Hub 与 Spaces 的基本概念。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 24GB 显存的 NVIDIA A10G GPU,每小时仅需几美元。
Hugging Face 发布博客介绍嵌入量化,将 float32 嵌入转为二值或 int8,分别带来 32 倍和 4 倍的内存与存储缩减。
推荐理由:用 41M 维基文本的实测数据说明二值与标量量化在检索速度、内存和成本上的取舍,方法可直接迁移。
JetBrains 使用 OpenAI 的 API 打造出公司史上增长最快的产品。该产品将 AI 嵌入开发者软件之中。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感财务信息,再投票选出隐私保护更强的模型。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。
推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布博客介绍 GaLore 优化器,可将优化器状态内存占用降低超过 82.5%,让 70 亿参数模型(如 Llama 架构)在 NVIDIA RTX 4090 等消费级 GPU 上训练。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的完整用法和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Holiday Extras 在全公司各团队部署 ChatGPT Enterprise,每周提升生产力 500 小时。这家旅游保险公司借此打造数据驱动、高效的企业文化。
Superhuman 宣布与 OpenAI 合作,推出由 AI 驱动的新一代邮件体验。官方称这标志着邮件进入新纪元,但未披露具体模型版本、功能细节或上线时间。
Salesforce 集成 OpenAI 的企业级 LLM,用于改造客户应用。此次集成强调企业就绪的可信与安全能力。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可一键调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,初版 WebSight-v0.1 包含 823,000 对 HTML 与截图,更新版 WebSight-v0.2 改用真实图片和 Tailwind CSS 并扩展至 200 万样本。
Hugging Face 博客展示如何借助 Optimum Intel 与 fastRAG,在基于 Xeon 的 CPU 上为 BGE 等嵌入模型带来显著性能提升,并轻松接入现有 RAG 流水线。
Healthify 与 OpenAI 合作,通过 AI 健康教练帮助数百万用户实现可持续减重。该合作旨在借助 AI 健康指导改善用户健康结果,覆盖大规模人群。
OpenAI 与 Le Monde 和 Prisa Media 两家国际新闻机构达成合作,将法语和西班牙语新闻内容引入 ChatGPT。
OpenAI 宣布审查已完成,Altman 与 Brockman 将继续领导公司,同时任命了新的董事会成员并引入治理结构方面的改进。
推荐理由:OpenAI 官方公布审查结论与治理结构调整,读者可据此了解其董事会与领导层的最新安排。
OpenAI 宣布 Sue Desmond-Hellmann 博士、Nicole Seligman 和 Fidji Simo 加入董事会,Sam Altman 同时重新加入董事会。
Lifespan 利用 GPT-4 大幅提升健康素养并改善患者预后。该机构借助 GPT-4 帮助患者更好理解医疗信息,从而改善健康结果。
Match Group 正在使用 ChatGPT Enterprise 激发创意并扩大影响力。OpenAI 介绍了这家公司借助企业版 ChatGPT 提升生产力的实践。
Paradigm 正使用 OpenAI 的 API 改善患者参与临床试验的可及性。该举措旨在让更多患者更容易找到并加入合适的临床试验。
OpenAI 就与 Elon Musk 的纠纷表态,称其始终致力于 OpenAI 的使命,并在每一步都坚持推进这一使命。
UCLA 研究者发布 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多个领域表现明显落后。用 OCR 或 caption 增强 LLM 的方案人类通过率仅 17.2%。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。