Frame-level shouting detection for music/speech using librosa features and a PyTorch Lightning CNN. Includes training, inference, visualization tools, Docker support, and diagnostics for inspecting labels and class balance.
docker deep-learning pytorch tensorboard mps speech-processing audio-processing computer-audio pytorc-lightning vocal-detection
-
Updated
Nov 13, 2025 - Python