跳至主要内容
造物矩阵

GitHub Repo

rasbt/reasoning-from-scratch

从零实现推理大模型的逐步教程,包含预训练基座模型加载、推理时扩展、强化学习GRPO和蒸馏等完整流水线代码。

artificial intelligencechain of thoughtgrpoinference time scalingllm trainingmodel deploymentreasoning modelreinforcement learning

推荐理由

想写“如何从零复现DeepSeek R1思路”的教程贴?这套代码可以直接当素材,也是做推理模型原型或强化学习GRPO入门的标杆参考。

二创切入点

  • 围绕项目能力写工具教程、场景拆解或对比评测。
  • 复制 GitHub 概要后可直接改写成文章、社媒卡片或选题备忘。
  • 生成分享卡片可以用于私域传播、收藏夹或选题库归档。

项目事实

语言
Jupyter Notebook
协议
apache-2.0
Issues
2
首次收录
2026/07/03