Its 552B-parameter backbone uses a causal encoder-decoder arrangement, activating 8B parameters during prefill and 16B during decoding. Compressed Sparse Attention 2 shares cache structures and sparse indices across layers. Additional mechanisms include FP4 KV caching, Engram conditional memory, and DSpark speculative decoding.
The model is useful for developers building agents that must reason over large documents, images, and extensive interaction histories. Its public checkpoint enables infrastructure-level experimentation, while a continuously adjustable reasoning setting trades computation for accuracy. Hosting remains a substantial multi-accelerator infrastructure task despite sparse activation.

