TECHNISCHE NOTIZEN

Notizen aus dem Projekt

Einrichtung, Fehler, Workarounds und Messungen, nachdem Quellen und Formulierungen geprüft wurden.

4× Intel Arc Pro B70 Server-Chassis für DFlash2 Speculative Decoding
ARCHITECTURE

DFlash & DFlash2: Block-Diffusion LLM-Speedup

Lokales LLM-Serving scheitert selten an der Rechenleistung, sondern an der Speicherbandbreite: 70B-Modelle sind auf 608 GB/s GDDR6 oft auf unter 16 Tokens/s limitiert. DFlash2 löst diese Blockade durch parallele Block-Diffusion statt sequenziellem Drafting und verdreifacht den Durchsatz auf Intel Arc und modernen Workstations – mathematisch verlustfrei und nativ integriert in vLLM und SGLang.

Schematische Darstellung der B65-Spezifikationsthemen: GDDR6-Speicher, Xe2-Recheneinheiten und PCI Express.
ARCHITECTURE

Intel Arc Pro B65: technische Daten eingeordnet

Intel nennt für die Arc Pro B65 32 GB GDDR6 und 608 GB/s. Diese Übersicht trennt GPU-Spezifikationen von Kartendetails und gemessener Inferenzleistung.

Schematische Darstellung von Backend-Auswahl, Funktionsimport und Modellstart.
TROUBLESHOOTING

SGLang v0.5.15.post1: Korrekturen für DSA und GLM-5.2

Der Patch SGLang v0.5.15.post1 betrifft DSA-Modellstarts, CUDA-Abhängigkeiten und GLM-5.2. Ein genauerer Blick auf den korrigierten CuTe-DSL-Import.

Schematische Darstellung von Decode-Graphen, abschnittsweisem Prefill und zuschaltbaren XPU-Graphen.
ARCHITECTURE

SGLang v0.5.15: XPU-Graphen und Speculative Decoding

SGLang v0.5.15 ergänzt XPU-Graphen und Speculative Decoding. Die Änderungen dokumentieren auch eine Grenze der Graph-Aufzeichnung im Intel-Testbackend.

Schematische Darstellung der Release-Themen: SYCL-mRoPE, INT8-Checkpoints und aktive BF16-Zustände.
ARCHITECTURE

SGLang v0.5.14: Änderungen an XPU und Prefix-Cache

Ein Blick auf SGLang v0.5.14: mRoPE für Intel XPU, die aktualisierte PyTorch-Abhängigkeit und optionale INT8-Checkpoints für lineare Attention.