跳到正文

#部署/工程

今日 9 条
5月22日周三
5月21日周二
5月16日周四
5月9日周四
5月6日周一
5月3日周五
5月1日周三
4月24日周三
  1. OpenAI News78

    OpenAI 宣布 GPT-4 API 正式可用,并公布旧版 Completions 模型退役计划

    OpenAI 宣布 GPT-4 API 正式可用,GPT-3.5 Turbo、DALL·E 和 Whisper API 也同步转为正式可用。同时 OpenAI 发布了旧版 Completions API 模型的退役计划,这些模型将于 2024 年初退役。

    推荐理由:OpenAI 官方公布 GPT-4 等 API 正式可用,并给出旧版 Completions 模型的退役时间表,便于开发者安排迁移。

4月23日周二
4月16日周二
4月10日周三
4月3日周三
4月2日周二
3月25日周一
3月22日周五
3月21日周四
3月20日周三
3月18日周一
3月15日周五
2月29日周四
2月21日周三
  1. Hugging Face Blog77

    Google 发布开源大模型 Gemma,Hugging Face 全面集成

    Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种规模,各有基础版与指令微调版共 4 个开放模型,上下文长度 8K tokens。Hugging Face 同步完成集成,覆盖 Transformers 4.38、Google Cloud、Inference Endpoints 以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 后,Hugging Face 同步给出 2B/7B 四个模型的集成与部署路径,可对照榜单分数判断其定位。

2月14日周三
2月8日周四
  1. Hugging Face Blog60

    Hugging Face 为 TGI 和 Inference Endpoints 推出兼容 OpenAI 的 Messages API

    Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接配合 OpenAI 客户端库以及 LangChain、LlamaIndex 使用。

    推荐理由:官方给出 OpenAI 兼容接口的接入方式与限制,读者可据此评估把现有 OpenAI 调用迁到开源模型的成本。

2月1日周四
1月30日周二
1月25日周四
1月15日周一
1月14日周日
12月11日周一
  1. Mistral AI85

    Mistral AI 发布开源稀疏 MoE 模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数 46.7B,每个 token 仅激活 12.9B 参数,推理速度比 Llama 2 70B 快 6 倍,在多数基准上匹配或超过 Llama 2 70B 与 GPT3.5,支持 32k token 上下文和英法意德西五种语言。

    推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比边界。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 与 AMD 实现 AMD GPU 上大语言模型开箱即用加速

    Hugging Face 与 AMD 宣布合作进展,Transformers 模型和任务现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。

    推荐理由:Hugging Face 与 AMD 公布开箱即用支持进展,读者可了解在 AMD Instinct 上运行 Transformers 与 TGI 的实际路径与性能对比。