DFlash & DFlash2: Block-Diffusion LLM-Speedup
Lokales LLM-Serving scheitert selten an der Rechenleistung, sondern an der Speicherbandbreite: 70B-Modelle sind auf 608 GB/s GDDR6 oft auf unter 16 Tokens/s limitiert. DFlash2 löst diese Blockade durch parallele Block-Diffusion statt sequenziellem Drafting und verdreifacht den Durchsatz auf Intel Arc und modernen Workstations – mathematisch verlustfrei und nativ integriert in vLLM und SGLang.