Notizen aus dem Projekt
Einrichtung, Fehler, Workarounds und Messungen, nachdem Quellen und Formulierungen geprüft wurden.
DFlash & DFlash2: Block-Diffusion LLM-Speedup
Lokales LLM-Serving scheitert selten an der Rechenleistung, sondern an der Speicherbandbreite: 70B-Modelle sind auf 608 GB/s GDDR6 oft auf unter 16 Tokens/s limitiert. DFlash2 löst diese Blockade durch parallele Block-Diffusion statt sequenziellem Drafting und verdreifacht den Durchsatz auf Intel Arc und modernen Workstations – mathematisch verlustfrei und nativ integriert in vLLM und SGLang.
Intel Arc Pro B65: technische Daten eingeordnet
Intel nennt für die Arc Pro B65 32 GB GDDR6 und 608 GB/s. Diese Übersicht trennt GPU-Spezifikationen von Kartendetails und gemessener Inferenzleistung.
SGLang v0.5.15.post1: Korrekturen für DSA und GLM-5.2
Der Patch SGLang v0.5.15.post1 betrifft DSA-Modellstarts, CUDA-Abhängigkeiten und GLM-5.2. Ein genauerer Blick auf den korrigierten CuTe-DSL-Import.
SGLang v0.5.15: XPU-Graphen und Speculative Decoding
SGLang v0.5.15 ergänzt XPU-Graphen und Speculative Decoding. Die Änderungen dokumentieren auch eine Grenze der Graph-Aufzeichnung im Intel-Testbackend.
SGLang v0.5.14: Änderungen an XPU und Prefix-Cache
Ein Blick auf SGLang v0.5.14: mRoPE für Intel XPU, die aktualisierte PyTorch-Abhängigkeit und optionale INT8-Checkpoints für lineare Attention.