DeepSeek V4 Flash na jednom procesoru AMD MI300X
Repository se zaměřuje na provozování modelu DeepSeek V4 Flash na jediné kartě AMD MI300X v produkčním prostředí. Obsahuje Docker Compose stack, konfiguraci vLLM, opravy pro kompatibilitu s MI300X a tuning tabulky pro optimalizaci výkonu.
Proč je AMD MI300X vhodný pro běh DeepSeek V4 Flash?
MI300X má 192 GB HBM3 paměti a 5,3 TB/s šířku pásma, což je 2,4× více než H100 SXM5. Celý 304B model se vejde do paměti bez PCIe streamování, zbývá místo na GPU KV cache a CPU offload prefix-cache záznamů. Zároveň stojí asi polovinu ceny H100.
Jaké byly hlavní technické výzvy při běhu na MI300X?
MI300X používá AMD/Graphcore variantu E4M3 pro FP8, zatímco novější GPU používají OCP-standard. Tato rozdílnost vyžadovala opravy FP8 kompatibility, AITER optimalizace, řešení problémů s MoE routingem a HIP-graph hazardy. Repo obsahuje tyto opravy předbalené.
Jaký výkon dosahuje daná konfigurace?
Single-stream decode: 168,6 tok/s, prefill: 7,9–8,5K tok/s, 8 souběžných streamů: 542 tok/s agregátu, 64-stream burst bez paměťové chyby. Model podporuje 256K kontext (architektura až 1M).
Co je v repozitáři obsaženo a jak se liší od oficiální vLLM receptury?
Repozitář přidává oprávky pro kompatibilitu MI300X, validovanou konfiguraci se spekulativním dekódováním DSpark-7, AITER GEMM tuning tabulky pro gfx942 a hybridní KV strategii s GPU cache a CPU offloadem. Oficiální vLLM recept cílí na NVIDIA a novější AMD GPU, ne na single-MI300X setup.
- DeepSeek-V4-Flash-0731 má lepší výkon než V4-Pro při menší velikosti — huggingface.co 80 % shoda
- Odemknutí všeho na CPU pomocí scramblování DRAM — github.com 78 % shoda
- Experiment s Gemma 4 jako offline překladačem — github.com 75 % shoda
- DeepSeek V4 Flash
- AMD MI300X
- vLLM3
- Docker Compose
- ROCm
- AITER
- DSpark
- Caddy
- HuggingFace