Qwen3-VL-8B-Instruct · TP=1
Messprofile, Ressourcen und Nachweise dieser Konfiguration; darunter Qualitäts- und Token-Beobachtungen.
- Laufreferenz
- Qwen3-VL-8B-Instruct-vllm-xpu-tp1-baseline
- Engine
- vLLM-XPU live
- Topologie / Gerät
- TP=1 · Intel Arc Pro B70 (32GB)
- Quantisierung
- BF16
- Betrieb
- Exklusive Nutzung
Qwen3-VL-8B-Instruct · TP=110KAPITEL
Messprofile · Workload
Messprofile
Vier getrennte Workloads mit den jeweils beobachteten Werten und Bedingungen.
Decode · Ausgabelänge
Decode · Ausgabelänge
Beobachtete Rohwerte · Mediane separat in der Tabelle.
| Messpunkt | ISL | OSL | Rohwert | TTFT |
|---|---|---|---|---|
| OSL 128 | 128 | 128 | 36,31 tok/s | 68,97 ms |
Rohbezug und vollständige Workload-Angaben
Statistik nur aus expliziten Angaben. Fehlende Statistik bleibt nicht gemessen.
| Messpunkt | ISL | OSL | Kontext | C | Decode | Aggregate decode | Per-request decode | TTFT |
|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-8B-Instruct-vllm-xpu-tp1-baseline | 128 | 128 | 16.384 | 1 | 36,31 tok/s | 36,31 tok/s | 36,31 tok/s | 68,97 ms |
TTFT
Für diesen Lauf nicht gemessen.
Kontextlänge
Für diesen Lauf nicht gemessen.
Parallelität
Parallelität · Gesamtdurchsatz
Beobachtete Rohwerte · Mediane separat in der Tabelle.Werte je Anfrage stehen im Rohbezug.
Kategorische Achse · gleiche Abstände zwischen Messpunkten.
| Messpunkt | C | OSL | Rohwert | TTFT |
|---|---|---|---|---|
| C=1 | 1 | 128 | 36,31 tok/s | 68,97 ms |
| C=2 | 2 | 128 | 72,25 tok/s | 96,88 ms |
| C=4 | 4 | 128 | 143 tok/s | 81,39 ms |
| C=8 | 8 | 128 | 281,18 tok/s | 892,17 ms |
| C=16 | 16 | 128 | 520,66 tok/s | 236,7 ms |
| C=32 | 32 | 128 | 938,4 tok/s | 358,25 ms |
| C=64 | 64 | 128 | 1.507,08 tok/s | 614,41 ms |
| C=128 | 128 | 128 | 2.312,22 tok/s | 1.153,79 ms |
| C=256 | 256 | 128 | 2.632,86 tok/s | 2.133,96 ms |
| C=512 | 512 | 128 | 2.779,15 tok/s | 7.589,26 ms |
| C=1.024 | 1.024 | 128 | 2.942,84 tok/s | 18.344,97 ms |
Rohbezug und vollständige Workload-Angaben
Statistik nur aus expliziten Angaben. Fehlende Statistik bleibt nicht gemessen.
| Messpunkt | ISL | OSL | Kontext | C | Aggregate decode | Per-request decode | TTFT |
|---|---|---|---|---|---|---|---|
| C=1 | 128 | 128 | 16.384 | 1 | 36,31 tok/s | 36,31 tok/s | 68,97 ms |
| C=2 | 128 | 128 | 16.384 | 2 | 72,25 tok/s | 36,38 tok/s | 96,88 ms |
| C=4 | 128 | 128 | 16.384 | 4 | 143 tok/s | 36,08 tok/s | 81,39 ms |
| C=8 | 128 | 128 | 16.384 | 8 | 281,18 tok/s | 35,28 tok/s | 892,17 ms |
| C=16 | 128 | 128 | 16.384 | 16 | 520,66 tok/s | 34,31 tok/s | 236,7 ms |
| C=32 | 128 | 128 | 16.384 | 32 | 938,4 tok/s | 31,8 tok/s | 358,25 ms |
| C=64 | 128 | 128 | 16.384 | 64 | 1.507,08 tok/s | 26,68 tok/s | 614,41 ms |
| C=128 | 128 | 128 | 16.384 | 128 | 2.312,22 tok/s | 22,12 tok/s | 1.153,79 ms |
| C=256 | 128 | 128 | 16.384 | 256 | 2.632,86 tok/s | 14,65 tok/s | 2.133,96 ms |
| C=512 | 128 | 128 | 16.384 | 512 | 2.779,15 tok/s | 13,35 tok/s | 7.589,26 ms |
| C=1024 | 128 | 128 | 16.384 | 1.024 | 2.942,84 tok/s | 12,83 tok/s | 18.344,97 ms |
Benchmark-Modul · resources
Speicher, Prefix-Cache und Energie
Dateigröße, beobachteter GPU-Speicher und reservierter KV-Cache bleiben getrennt. Energie benötigt Gerät, Phase, Intervall und Quelle.
Speicher nach Phase und Gerät
Checkpoint auf Disk: Nicht gemessen
| Gerät | Idle | Post-load | KV reserviert | Peak | Quelle |
|---|---|---|---|---|---|
| Speicher | Nicht gemessen | ||||
Prefix-Cache · Cold / Warm
Ein Vergleich braucht ein passendes Cold/Warm-Paar desselben Präfixes.
- Cold
- Nicht gemessen
- Warm
- Nicht gemessen
Energie je Gerät und Intervall
- Gerät
- Nicht gemessen
- Phase
- Nicht gemessen
- Energie
- Nicht gemessen
- Leistung
- Nicht gemessen
- Dauer
- Nicht gemessen
- Quelle
- Nicht gemessen
Benchmark-Modul · evidence
Messartefakt und Nachweise
Ein Prüfreport gehört zu einem exakten Artefakt-Digest. Rohartefakt, publizierte Ableitung und Reproduktionsangaben haben unterschiedliche Rollen.
Artefakt und Prüfreport
- SHA-256
- live-capture
Rohartefakt: Nicht verfügbar
Prüfreport: unvalidated_live_capture
Reproduktion und Zuordnung
- Run-ID
- Qwen3-VL-8B-Instruct-vllm-xpu-tp1-baseline
- Modellrevision
- Nicht verfügbar
- Messzeitpunkt
- 2026-09-08T15:00:09.865288+00:00
- Quelle
- Nicht verfügbar
Reproduktionsangaben: Nicht verfügbar.
Modellqualität · Vergleichskontext
Modellqualität und Quantisierung
Qualität, Durchsatz und Speicher gelten für die angegebene Modellversion, Quantisierung und Evaluationsmethode.
Evaluation auswählen
Bewertung steht noch aus. Für diesen Lauf liegen keine Evaluationsdaten vor.
- Qualität
- Nicht gemessen
- Durchsatz
- Nicht gemessen
- Speicher
- Nicht gemessen
Vergleich · drei Darstellungen
Qualität × Tempo · drei Ansichten
Drei Darstellungen derselben Qualitäts- und Durchsatzwerte. Absolute Achsen behalten ihre Einheiten; die Normierung ist nur eine Darstellungshilfe.
Bewertung steht noch aus. Für diesen Lauf liegen keine Evaluationsdaten vor.
Token-Beobachtungen
Speculative Decoding
Angefordertes und tatsächlich wirksames Verhalten sind getrennte Angaben. Ein Zähler ersetzt keine Token-Spur.
Token-Beobachtungen für diesen Lauf nicht verfügbar.
Angefordert vs. wirksam
- Angefordert
- Nicht angegeben
- Wirksam
- Nicht angegeben
- Vorgeschlagen
- Nicht gemessen
- Akzeptiert
- Nicht gemessen
- Verworfen
- Nicht gemessen
- Nicht verwendet
- Nicht gemessen
Korrektheitsfälle
Keine Korrektheitsfälle angegeben.
Token-Beobachtungen
Acceptance Map
Akzeptierte, verworfene und nach Abbruch nicht verwendete Vorschläge bleiben unterscheidbar.
Token-Beobachtungen für diesen Lauf nicht verfügbar.
Token-Beobachtungen
Token-Latenz
Die Folge zeigt einzelne Token-Ereignisse mit ihrer beobachteten Latenz. Durchsatzaggregate erzeugen keine Token-Zeitreihe.
Token-Beobachtungen für diesen Lauf nicht verfügbar.
Runde × Token
Token-Heatmap
Unabhängige Latenzbeobachtungen nach Runde und Token. Abgelehnte und nicht ausgewertete Zellen bleiben getrennt.
Für diesen Lauf nicht gemessen