Machine-verifiable evidence chain for online LLM post-training (TRL GRPO + vLLM): trajectory contracts, fault injection F1-F8, guarded updates, paired gradient replay
-
Updated
Sep 29, 2026 - Python
Machine-verifiable evidence chain for online LLM post-training (TRL GRPO + vLLM): trajectory contracts, fault injection F1-F8, guarded updates, paired gradient replay
Zero-loss deep learning training on shared SLURM clusters: relay chains, durable checkpoints, single-writer guards, queue economics
To associate your repository with the training-infrastructure topic, visit your repo's landing page and select "manage topics."