-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathHello.py
More file actions
58 lines (49 loc) · 2.88 KB
/
Copy pathHello.py
File metadata and controls
58 lines (49 loc) · 2.88 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
"""
LLM 从基础到前沿 — Part III: 对齐与后训练
80 章 = 5 Parts × 16 章:
Part I: 基础与架构 (01-16) ✅ LLMBasic
Part II: 训练与推理 (17-32) ✅ LLMTrainingAndInference
Part III: 对齐与后训练 (33-48) ← 当前 LLMAlignment
Part IV: 高级能力 (49-64) LLMAdvance
Part V: 前沿与应用 (65-80) LLMFrontier
快速运行:
python3 Hello.py
python3 33_sft/sft.py
python3 38_dpo/dpo.py
python3 43_peft_lora/peft_lora.py
"""
def main():
print("╔══════════════════════════════════════════════════════╗")
print("║ LLM 从基础到前沿 — 对齐与后训练 (Part III) ║")
print("║ 清华大学 · 计算机科学与技术系 ║")
print("╚══════════════════════════════════════════════════════╝\n")
chapters = [
("33", "SFT — 监督微调", "从续写器到助手 · Loss Masking"),
("34", "SFT 数据工程", "收集·清洗·合成·Self-Instruct"),
("35", "RLHF 概览", "三阶段流水线 · 偏好 > 评分"),
("36", "奖励模型", "Bradley-Terry · 奖励 Hacking"),
("37", "PPO — 近端策略优化", "KL约束 · Clip · GAE"),
("38", "DPO — 直接偏好优化", "闭式解 · 跳过RM+PPO"),
("39", "DPO 变体全家桶", "IPO · KTO · ORPO · SimPO"),
("40", "Constitutional AI & RLAIF","AI宪法 · AI替代人类"),
("41", "安全与红队测试", "攻击·越狱·安全训练"),
("42", "LLM 评估体系", "MMLU · Arena · LLM-as-Judge"),
("43", "PEFT & LoRA", "低秩适配 · QLoRA · 10GB微调7B"),
("44", "Full FT vs PEFT", "灾难性遗忘 · 多Adapter"),
("45", "偏好数据", "收集·多维度·偏差"),
("46", "对齐税", "能力退化 · 模式坍塌 · 平衡"),
("47", "RLHF 替代方案", "Rejection · RRHF · SPIN"),
("48", "对齐的未来", "Superalignment · 参与式对齐"),
]
for num, title, desc in chapters:
print(f" {num:>2s} │ {title:<32s} │ {desc}")
print()
print(f" 运行示例:")
print(f" python3 33_sft/sft.py")
print(f" python3 38_dpo/dpo.py")
print(f" python3 43_peft_lora/peft_lora.py")
print(f" python3 48_alignment_future/alignment_future.py")
print(f"\n 已完成: Part I (16) + Part II (16) + Part III (16) = 48/80")
print(f" 仓库: https://github.com/AgentZero2002/LLMAlignment")
if __name__ == "__main__":
main()