The system combines a pretrained large language model and audio tokenizer with per-token conditional flow matching. It generates variable-length 16 kHz audio autoregressively using 768-dimensional semantic-acoustic latents at 25 Hz and a learned stop head.
Audio-text alignment pretraining maps audio latents into the language model token space before generation training. The result is a research system aimed at multimodal sound design, interactive environments, synthetic data, and multilingual expressive audio generation.

