跳到正文

#教程/实践

今日 3 条
10月24日周一
10月21日周五
10月14日周五
10月13日周四
10月12日周三
9月27日周二
9月16日周五
9月8日周四
9月7日周三
8月24日周三
8月22日周一
8月19日周五
8月18日周四
8月17日周三
8月12日周五
  1. Hugging Face Blog22

    Hugging Face 的 TensorFlow 哲学

    Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计理念:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并配合 AutoTokenizer 完成匹配的预处理。

8月11日周四
8月10日周三
8月5日周五
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程第 8 单元:Proximal Policy Optimization (PPO)

    Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization (PPO),通过在当前策略与旧策略的概率比上做裁剪(范围 [1−ϵ,1+ϵ])来限制每轮策略更新幅度,避免更新过大导致训练不稳定。课程随后用 PyTorch 从零实现 PPO,并在 CartPole-v1 和 LunarLander-v2 上验证。

8月2日周二
7月27日周三
7月25日周一
7月22日周五
  1. Hugging Face Blog18

    Hugging Face 深度强化学习课程:Advantage Actor Critic (A2C)

    Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C),一种结合基于策略与基于价值方法的混合架构,通过 Critic 评估动作价值来降低 Reinforce 中蒙特卡洛采样带来的高方差,从而稳定并加速训练。课程使用 Stable-Baselines3 在 PyBullet 机器人环境中训练双足步行者和蜘蛛两个智能体行走。

7月16日周六
7月14日周四
7月13日周三
7月7日周四
6月30日周四
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程第 5 单元:用 PyTorch 实现策略梯度

    Hugging Face 深度强化学习课程第 5 单元讲解策略梯度方法,并从头用 PyTorch 实现首个基于策略的算法 Reinforce,随后在 CartPole-v1、PixelCopter 和 Pong 上测试其鲁棒性。策略梯度直接优化策略、无需估计价值函数,可学习随机策略并省去手工的探索/利用权衡,更适合高维和连续动作空间,但易收敛到局部最优、训练更慢且方差较高。

6月29日周三
  1. Hugging Face Blog22

    如何用 Sentence Transformers 开启你的第一个机器学习项目

    Hugging Face 发文介绍如何以 Sentence Transformers(ST)为例从零上手一个新 ML 库并完成首个自驱项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等应用。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目和包依赖它。

6月28日周二
6月23日周四
6月22日周三
6月9日周四
6月7日周二
6月2日周四
5月20日周五
5月18日周三
5月10日周二
5月4日周三