UNABHÄNGIGES ENTHUSIASTENPROJEKT / 4× ARC PRO B70 (128 GB)

Intel Arc in einer echten Workstation.

Ich habe ein System mit vier Intel Arc Pro B70 gebaut und dokumentiere, was ich bei lokaler LLM-Inferenz mit vLLM, SGLang und llama.cpp lerne. Das Ziel ist schlicht: reproduzierbare Befehle, rohe Beobachtungen und klare Grenzen dessen, was ein Test tatsächlich aussagt.

BENCHMARK-DATEN | Veröffentlichte Benchmarkläufe: 56. Messprofile und Prüfreports stehen auf den Detailseiten.
DIE WORKSTATION

Threadripper Pro 9965WX · WRX90E-SAGE · 4× Arc Pro B70

Hardware-Details →

Vier Karten mit jeweils 32 GB, direkt über PCIe angebunden. Softwareversionen, Startbefehle und Messbedingungen gehören an jedes einzelne Ergebnis statt in eine pauschale Seitenbehauptung.

Aktuelle Notizen

Geprüfte technische Notizen aus dem Projekt:

Alle Notizen →
LEAD INVESTIGATION ARCHITECTURE

DFlash & DFlash2: Block-Diffusion LLM-Speedup

Lokales LLM-Serving scheitert selten an der Rechenleistung, sondern an der Speicherbandbreite: 70B-Modelle sind auf 608 GB/s GDDR6 oft auf unter 16 Tokens/s limitiert. DFlash2 löst diese Blockade durch parallele Block-Diffusion statt sequenziellem Drafting und verdreifacht den Durchsatz auf Intel Arc und modernen Workstations – mathematisch verlustfrei und nativ integriert in vLLM und SGLang.