← Back to teaching
Fall 2026Reading Seminar

Foundation Models:
Theory and Applications

大模型的代码与数学能力是怎样炼出来的?

Peking University · MELON Research Group

16 周课程 · Coding 6 周每周两场报告数学专题保留 · 周次待定
About this course

课程介绍

本学期围绕“大模型的代码与数学能力是怎样炼出来的”展开。前六周沿模型—数据—训练—完整案例—长程 Agent 五个问题研究 Coding,优先选择近期完整工作,先建立整体认识,再理解关键机制,不以局部技术细节组织报告。第一周梳理代码模型的训练路线,第四周研究近期 Agent 模型如何整合各环节。课程按 16 周规划,第 7–16 周留给数学,具体排期待定;原有 12 个数学专题作为候选池保留,不是额外 12 周。

讨论方式

每周两位报告人。Coding 每周四篇主要候选文献,供选择而非要求全部讲完;可围绕问题整合、增补或替换高质量文献,不预设组合,不限制讲解篇数。注册时注明拟讲论文和要回答的问题,避免两场报告重复。

排期说明:第 1–6 周为 Coding;第 7–16 周数学安排待定。M01–M12 是原有数学专题编号,不是周次,本轮不删减或重排其中的文献。

Schedule & reading pool

课程安排与候选文献

Learning from coding

Coding:模型、数据、训练与长程 Agent

WEEKS 01–06
01

强代码模型是怎样炼出来的?先建立整体认识

讨论问题从通用底座到强代码模型,预训练、数据构建和后训练分别承担什么角色?一条完整训练路线需要哪些条件?

候选文献 4
  1. 阅读抓手以文件级、仓库级预训练到指令与偏好训练的全流程,建立代码模型训练地图。

    要回答的问题各阶段把模型从“读懂代码”推向哪些能力?哪些能力不能只靠增加代码语料获得?

  2. 阅读抓手以通用底座继续训练为例,连接代码、数学与自然语言数据,以及后训练。

    要回答的问题专用代码能力如何建立在通用底座上?继续预训练与后训练怎样分工?

  3. 阅读抓手从可复现的数据流水线、预训练、退火到两阶段 SFT,理解建设代码模型需要什么。

    要回答的问题有模型权重为什么还不等于能复现能力?团队必须掌握哪些训练资产?

  4. 阅读抓手以模型辅助数据建设和 instruct / reasoning 两条训练路径,比较不同能力目标的配方。

    要回答的问题“会按要求写代码”和“会解难题”是否应采用同一训练路线?人工和模型各做什么?

02

代码、题目与交互经验:训练数据从哪里来?

讨论问题自然代码、合成问题、教师推理轨迹与仓库交互任务各提供什么学习信号?如何规模化生产而不丢失多样性和可信性?

候选文献 4
  1. 阅读抓手研究大规模真实代码及关联资料的来源、组织与治理,而非只看数据量。

    要回答的问题自然代码库提供哪些合成解答难以替代的知识?收集后还需要做哪些工作?

  2. 阅读抓手研究从已有竞赛题蒸馏教师推理,以及数据覆盖、规模与执行过滤的实验。

    要回答的问题强教师的推理怎样成为有效训练数据?只保留正确答案会不会改变题目难度分布?

  3. 阅读抓手研究从多类种子生成问题、解答与测试,再构建 SFT / RL 数据的完整流程。

    要回答的问题如何同时生成新任务和可用反馈?生成者与验证者共享错误时,哪些保障仍然缺失?

  4. 阅读抓手把数据单位从题目—答案扩展为仓库环境、故障任务与教师交互轨迹。

    要回答的问题怎样批量生产能训练软件工程能力的数据?真实仓库和合成故障分别贡献什么?

延伸与替换候选 非额外必读

  1. 阅读抓手用于理解数据时间切分和污染控制,不单独占用数据生产的主阅读名额。

    要回答的问题如何证明数据提升不是测试集泄漏?

03

SFT、蒸馏与 RL 怎样炼出代码推理能力?

讨论问题模仿教师、筛选自生成解答和通过反馈探索,分别能带来什么进步?如何证明训练改善了难题求解,而非只增加推理长度或采样次数?

候选文献 4
  1. 阅读抓手围绕 R1-Zero、R1 与蒸馏模型的关系,建立 SFT—RL—蒸馏的整体认识;重点看代码结果。

    要回答的问题RL 和教师蒸馏分别把什么能力教进模型?为什么纯 RL 实验与最终模型不是同一条配方?

  2. 阅读抓手比较 o1、o1-ioi 与 o3,理解更强推理训练与人工搜索系统的关系。

    要回答的问题哪些搜索策略可以由训练后的模型自行组织?怎样区分训练算力和推理算力的收益?

  3. 阅读抓手研究在已蒸馏的小模型上继续 RL,以及代码难度、反馈质量和数学—代码迁移的实验。

    要回答的问题蒸馏之后 RL 还能改善什么?哪些实验支持难题能力的提升,哪些结论仍依赖底座和数据?

  4. 阅读抓手作为不依赖大规模在线 RL 的对照,研究自生成任务、解答、测试和筛选微调的闭环。

    要回答的问题不靠更强教师,模型何时也能从自己生成的数据中学到东西?这与 RL 有什么根本差别?

04

近期 Agent 模型案例:如何把各训练环节连起来?

讨论问题近期强模型如何把底座、交互数据、专家训练、RL 和能力整合连接成完整路线?哪些环节已披露,哪些仍不足以复现?

候选文献 4
  1. Qwen3-Coder-Next Technical Report2026 · 多轮训练案例

    阅读抓手以代码专用 Agent 模型为例,贯通中训练、交互示范、专家训练、多轮 RL 与蒸馏。

    要回答的问题如何将多个训练阶段组织成一个代码 Agent?哪些环节针对真实交互而不是静态解题?

  2. 阅读抓手重点读代码与 Agent 路线:交互轨迹、可执行环境、异步 RL 和工程任务评测。

    要回答的问题从生成代码走向完成工程任务,训练对象与训练基础设施发生了什么变化?

  3. 阅读抓手重点读工具交互数据、真实代码沙箱、SFT 与 RL,理解通用 Agent 中的代码能力。

    要回答的问题模拟交互与真实执行如何配合?代码能力为什么不能脱离工具学习和环境反馈单独解释?

  4. 阅读抓手研究可执行仓库、任务与轨迹生成、Agent RL、跨 harness 训练和专家能力整合。

    要回答的问题将“有数据”变成“能可靠训练”还缺哪些环节?失败恢复经验怎样进入完整配方?

05

从代码模型到软件工程 Agent:系统需要具备什么?

讨论问题模型、工具、运行环境与任务流程怎样组成可工作的软件工程 Agent?怎样评估它能否完成真实的多步工作?

候选文献 4
  1. 阅读抓手保留这一基础范式:真实 issue、仓库与测试怎样共同定义软件工程任务。

    要回答的问题为什么函数生成高分还不能说明模型会做软件工程?需要补测哪些能力?

  2. 阅读抓手从完整的模型—工具—环境交互流程理解 Agent,并用固定模型的实验分析系统贡献。

    要回答的问题不更新模型参数,系统设计为什么也能显著影响任务完成率?怎样和训练收益区分?

  3. 阅读抓手从完整开发 Agent 平台理解动作、观察、运行环境、工具和多任务评测。

    要回答的问题一个能实际工作的软件开发 Agent 包含哪些部分?哪些可复用,哪些需要任务适配?

  4. 阅读抓手从终端中的端到端技术任务和失败分析,理解代码 Agent 不只是生成补丁。

    要回答的问题任务依赖一连串行动时,什么才算完成?怎样区分模型、scaffold 与资源限制的影响?

延伸与替换候选 非额外必读

  1. 阅读抓手补充持续更新的真实任务和环境构建流程。

    要回答的问题怎样刷新任务,同时控制难度漂移与环境可复现性?

  2. 阅读抓手2026 年 Verified 审计;困难子集的缺陷比例不能外推到全体。

    要回答的问题如何区分饱和、污染、测试过严与题面信息不足?

  3. 阅读抓手2026 年 SWE-Bench Pro 审计,不是重复审计 Verified。

    要回答的问题如何同时检查假阴性、假阳性、题面缺失与误导?

  4. 阅读抓手可选的简单流程对照。

    要回答的问题什么时候预定义流程已经足够?

  5. 阅读抓手可选复杂仓库任务;结合 Pro 的官方审计阅读。

    要回答的问题更难的任务是否就有更可信的评测?

06

多步 Agent 能力怎样从交互经验中训练出来?

讨论问题静态补丁训练、成功交互轨迹 SFT、在线 Agent RL 和推理时筛选,各自解决什么问题?如何让整个学习闭环规模化?

候选文献 4
  1. 阅读抓手研究从可执行环境到交互轨迹微调、验证器和候选选择的基础闭环。

    要回答的问题为什么训练数据必须包含交互环境?训练 Agent 与训练 verifier 怎样分工?

  2. 阅读抓手研究环境规模化、轨迹学习和推理时验证如何共同提升开源软件工程 Agent。

    要回答的问题增加环境、增加轨迹和增加推理时筛选,分别何时有效、何时遇到上限?

  3. 阅读抓手用历史软件修改记录训练推理,作为无需完整多轮环境的路线对照。

    要回答的问题历史补丁能教会哪些能力,又遗漏了哪些交互经验?它与真正在线 Agent RL 的差异在哪里?

  4. 阅读抓手研究基于现有 Qwen3 模型和 R2E-Gym 环境的多轮 RL、公开训练流程与测试时选择。

    要回答的问题在线交互 RL 如何从可执行任务中学到行为?模型训练提升与多轨迹选择提升如何分开?

Building mathematical reasoning

数学能力的训练与内化

MATH · 待排期
M01

数学能力的底座是怎样预训练出来的?

讨论问题通用规模化、数学语料继续预训练和代码底座分别贡献什么;如果基础模型缺少知识,后训练能否仅靠推理轨迹补回来?

候选文献 4
  1. 模型规模、训练 token 与计算预算怎样共同决定基础能力。

  2. 在通用模型上继续训练技术语料,能把数学能力推到什么程度。

  3. 数学与代码语料的继续预训练怎样支持解题、工具调用和定理证明。

  4. 数学数据抓取、代码模型底座、继续预训练、SFT 与 GRPO 如何连接。

M02

怎样用推理轨迹把“会生成答案”教进参数?

讨论问题轨迹蒸馏真正教的是知识、解题路径还是输出风格;轨迹的数量、质量、难度和多样性应如何取舍?

候选文献 5
  1. 把教师 rationale 作为额外监督,为何能提高小模型的数据效率。

  2. 自然语言 CoT 与程序式 PoT 轨迹怎样共同训练数学通才模型。

  3. 少量高质量长轨迹何时足以激活预训练中已有的数学知识。

  4. 轨迹难度和多样性如何影响蒸馏效率及分布外泛化。

M03

Verifier 怎样从“挑答案”变成训练数学能力的反馈?

讨论问题结果正确但过程错误时,应训练结果 Verifier、过程奖励模型还是 Critic;错误的验证信号会怎样反过来塑造模型?

候选文献 4
  1. 生成大量候选并用结果 Verifier 排序,为何能随数据和推理预算扩展。

  2. 人工过程监督与结果监督相比,怎样改变 Verifier 和解题效果。

  3. 没有人工逐步标签时,如何构造近似过程监督并用于重排和 RL。

  4. 过程标签、聚合方式和评测设置为何可能反转 PRM 的结论。

M04

R1 类长推理能力是怎样用 RL 炼出来的?

讨论问题纯规则奖励为何会出现长 CoT、自检和回退;基础模型、冷启动数据、采样规模、优化算法与蒸馏分别承担什么角色?

候选文献 4
  1. 理解 policy ratio、clipping 与多轮采样更新,建立阅读大模型 RL 的最低基础。

  2. R1-Zero、冷启动、多阶段 RL 与蒸馏怎样组成完整能力配方。

  3. 极简规则奖励和 PPO 能在多大程度上复现 R1-Zero。

  4. 长上下文、数据混合、策略优化与 long-to-short 怎样共同扩展推理能力。

M05

长推理 RL 怎样稳定扩大,而不是只学会输出更长?

讨论问题长度偏置、稀疏奖励、采样失衡和 credit assignment 会制造哪些假进步;工程改动与过程奖励能否真正改善训练信号?

候选文献 4
  1. 基础模型偏置、GRPO 长度偏置与 Dr. GRPO 揭示了哪些问题。

  2. 解耦裁剪、动态采样等设计怎样稳定大规模长 CoT RL。

  3. SFT、基础能力、训练算力与 reward shaping 各自控制什么。

  4. 如何仅凭结果标签和在线 rollout 学习隐式过程奖励。

M06

推理时搜索怎样转化为能力,又能否蒸馏回模型?

讨论问题在固定预算下,应增加单条思考长度、并行采样、Verifier 重排还是树搜索;哪些收益属于 Agent Scaffold,哪些能被后训练内化?

候选文献 4
  1. 多路径采样与答案聚合如何把 pass@k 潜力转成 pass@1。

  2. 问题难度、搜索策略和推理预算怎样决定 test-time compute 的收益。

  3. MCTS 与二分定位如何从结果监督生成过程标签。

  4. 一千条筛选轨迹与 budget forcing 怎样共同产生推理时扩展。

M07

数学能否复制 Coding 的“可执行反馈闭环”?

讨论问题Lean、符号求解器与错误信息能否为数学提供类似编译器和单元测试的反馈;代价是把原任务改造成了什么能力?

候选文献 5
  1. Lean 环境、前提检索和可执行验证怎样构成开放训练接口。

  2. 自然语言子目标、Lean 证明合成、冷启动数据与 RL 如何连接。

  3. 符号演绎、合成定理与语言模型引导搜索怎样形成数据飞轮。

  4. 形式系统的错误消息怎样支持整段证明生成后的自动修复。

  5. 自然语言推理与代码执行交替进行

M08

怎样判断能力已内化,并把小模型结论扩展到大模型?

讨论问题强教师的正确轨迹是否一定可学;RL 后 pass@1 上升但高采样 pass@k 不升时,模型究竟学到了新推理还是只重排了已有策略?

候选文献 5
  1. 长而强的教师轨迹为何可能超出小模型的可学习区间。

  2. 小模型训练动态能否低成本指导大模型选择训练数据。

  3. 大 k 的 pass@k 如何区分成功概率重排与能力边界扩展。

  4. 为什么只看答案覆盖可能低估 RL 对推理过程正确性的改善。

  5. 改变 GSM8K 中的数字发现所有模型性能下降

Measuring capabilities

数学推理 Benchmark

MATH · 待排期
M09

我们究竟在测哪一种数学推理能力?

讨论问题最终答案、逐步纠错、竞赛难题和专家原创题分别测到了什么;“题更难”是否等于更接近真实能力边界?

候选文献 4
  1. MATH 怎样建立竞赛数学评测,又留下了哪些覆盖和饱和问题。

  2. 怎样扩大奥数题型、子领域与难度覆盖。

  3. 定位最早错误步骤怎样测量与解题不同的能力。

  4. 专家原创高阶题、污染控制与高验证成本怎样权衡。

M10

怎样让数学 Benchmark 低污染、可诊断且可验证?

讨论问题动态更新、行为测试、私有隐藏集与形式验证怎样组合;确定性验证会不会把数学推理替换成形式化和库检索能力?

候选文献 4
  1. 怎样把抽象能力假设拆成可诊断的最小行为测试。

  2. 客观评分和持续更新如何缓解污染与饱和。

  3. 跨证明系统的形式化竞赛数学评测如何建立。

  4. 高难本科数学、跨形式系统与定理证明器评测怎样结合。

Synthesizing training data

任务与推理轨迹合成

MATH · 待排期
M11

怎样自动生成“新而有用”的数学任务与成功轨迹?

讨论问题改写题面、提高难度、扩大问题多样性和自生成课程,哪一种真正扩展了训练分布,而不是制造近重复或污染测试集?

候选文献 4
  1. 模型自生成、过滤和迭代扩充训练任务的基础范式。

  2. 从多个角度重写数学题能带来什么,又为何不等于新知识。

  3. 教师强度、解答格式、题目多样性和数据规模如何影响数学 SFT。

  4. 模型提出可执行验证的任务并自我求解,能否形成自适应课程闭环。

M12

怎样把搜索、失败与恢复过程变成可训练数据?

讨论问题只保留漂亮的正确解答会丢失什么;搜索树、错误节点、Verifier 反馈与回退轨迹应怎样转成 SFT、PRM 或 RL 信号?

候选文献 4
  1. “生成—验证—再训练”怎样从模型自身产出推理轨迹。

  2. 显式分支、状态评价与回退怎样表示非线性推理过程。

  3. 过程奖励引导的搜索树怎样转化为自训练数据。

  4. 小模型互评、MCTS 与过程监督怎样共同生成训练信号。

回到顶部 ↑