端到端语音模型研究工具:音频编码、因果解码、联合训练与流式协议。
Chen Yuxuan · 广州大学(Guangzhou University)。
历史说明:本仓库由经过验证的补丁序列重建;2025 年至 2026 年 8 月的 Git 时间戳用于展示项目演进,不代表代码实际开发日期。
python -m venv .venv
source .venv/bin/activate
pip install -e '.[dev]'python -m speechloom tokenize '广州大学' --audio-codes 0,128,255
python examples/codec_roundtrip.py
python examples/stream_text.py文本采用无损 UTF-8 byte token。音频码本分配独立 ID 区间,避免模态碰撞。
训练时输出序列为 BOS + text + separator + audio_codes + EOS。
pip install torch --index-url https://download.pytorch.org/whl/cpu
python examples/train_tiny.py提供可以训练的紧凑研究原型和完整数据链路。示例使用合成输入,验证损失下降、 梯度和掩码正确性;不包含经过大规模训练的权重,也没有真实语料成绩声明。
python -m build
python -m pytest -q
ruff check .
ruff format --check .MIT License · Chen Yuxuan