Skip to content
 
 

Repository files navigation

speechloom

端到端语音模型研究工具:音频编码、因果解码、联合训练与流式协议。

Chen Yuxuan · 广州大学(Guangzhou University)。

历史说明:本仓库由经过验证的补丁序列重建;2025 年至 2026 年 8 月的 Git 时间戳用于展示项目演进,不代表代码实际开发日期。

CI

快速开始

python -m venv .venv
source .venv/bin/activate
pip install -e '.[dev]'
python -m speechloom tokenize '广州大学' --audio-codes 0,128,255
python examples/codec_roundtrip.py
python examples/stream_text.py

文本采用无损 UTF-8 byte token。音频码本分配独立 ID 区间,避免模态碰撞。 训练时输出序列为 BOS + text + separator + audio_codes + EOS

模型实验

pip install torch --index-url https://download.pytorch.org/whl/cpu
python examples/train_tiny.py

提供可以训练的紧凑研究原型和完整数据链路。示例使用合成输入,验证损失下降、 梯度和掩码正确性;不包含经过大规模训练的权重,也没有真实语料成绩声明。

文档

验证

python -m build
python -m pytest -q
ruff check .
ruff format --check .

MIT License · Chen Yuxuan

About

End-to-end speech model research: waveform encoding, causal decoding, codec tokens, joint losses and streaming.

Resources

Code of conduct

Contributing

Security policy

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages