TECH FLOW Svět Androida
← Zpět do proudu
github.com · vybral Petr Mišák · před 60 dny

DeepSeek V4 Flash na jednom procesoru AMD MI300X

Náhled zdroje: DeepSeek V4 Flash na jednom procesoru AMD MI300X
Shrnutí AI

Repository se zaměřuje na provozování modelu DeepSeek V4 Flash na jediné kartě AMD MI300X v produkčním prostředí. Obsahuje Docker Compose stack, konfiguraci vLLM, opravy pro kompatibilitu s MI300X a tuning tabulky pro optimalizaci výkonu.

Shrnutí píše AI ze zdroje, není to stanovisko redakce. Podrobnosti najdete ve zdroji.

8 lidí už zdroj otevřelo

Otázky a odpovědi AI
Proč je AMD MI300X vhodný pro běh DeepSeek V4 Flash?

MI300X má 192 GB HBM3 paměti a 5,3 TB/s šířku pásma, což je 2,4× více než H100 SXM5. Celý 304B model se vejde do paměti bez PCIe streamování, zbývá místo na GPU KV cache a CPU offload prefix-cache záznamů. Zároveň stojí asi polovinu ceny H100.

Jaké byly hlavní technické výzvy při běhu na MI300X?

MI300X používá AMD/Graphcore variantu E4M3 pro FP8, zatímco novější GPU používají OCP-standard. Tato rozdílnost vyžadovala opravy FP8 kompatibility, AITER optimalizace, řešení problémů s MoE routingem a HIP-graph hazardy. Repo obsahuje tyto opravy předbalené.

Jaký výkon dosahuje daná konfigurace?

Single-stream decode: 168,6 tok/s, prefill: 7,9–8,5K tok/s, 8 souběžných streamů: 542 tok/s agregátu, 64-stream burst bez paměťové chyby. Model podporuje 256K kontext (architektura až 1M).

Co je v repozitáři obsaženo a jak se liší od oficiální vLLM receptury?

Repozitář přidává oprávky pro kompatibilitu MI300X, validovanou konfiguraci se spekulativním dekódováním DSpark-7, AITER GEMM tuning tabulky pro gfx942 a hybridní KV strategii s GPU cache a CPU offloadem. Oficiální vLLM recept cílí na NVIDIA a novější AMD GPU, ne na single-MI300X setup.

Otázky i odpovědi píše AI podle tématu, ne ze zdroje. Není to stanovisko redakce.
Souvisí z proudu
Zmiňuje
  • DeepSeek V4 Flash
  • AMD MI300X
  • vLLM3
  • Docker Compose
  • ROCm
  • AITER
  • DSpark
  • Caddy
  • HuggingFace