Qwen2.5-Coder-7B-Instruct · TP=1
Messprofile, Ressourcen und Nachweise dieser Konfiguration; darunter Qualitäts- und Token-Beobachtungen.
- Laufreferenz
- Qwen2.5-Coder-7B-Instruct-vllm-xpu-tp1-baseline
- Engine
- vLLM-XPU live
- Topologie / Gerät
- TP=1 · Intel Arc Pro B70 (32GB)
- Quantisierung
- BF16
- Betrieb
- Exklusive Nutzung
Qwen2.5-Coder-7B-Instruct · TP=110KAPITEL
Messprofile · Workload
Messprofile
Vier getrennte Workloads mit den jeweils beobachteten Werten und Bedingungen.
Decode · Ausgabelänge
Decode · Ausgabelänge
Beobachtete Rohwerte · Mediane separat in der Tabelle.
| Messpunkt | ISL | OSL | Rohwert | TTFT |
|---|---|---|---|---|
| OSL 128 | 128 | 128 | 38,56 tok/s | 64,35 ms |
Rohbezug und vollständige Workload-Angaben
Statistik nur aus expliziten Angaben. Fehlende Statistik bleibt nicht gemessen.
| Messpunkt | ISL | OSL | Kontext | C | Decode | Aggregate decode | Per-request decode | TTFT |
|---|---|---|---|---|---|---|---|---|
| Qwen2.5-Coder-7B-Instruct-vllm-xpu-tp1-baseline | 128 | 128 | 16.384 | 1 | 38,56 tok/s | 38,56 tok/s | 38,56 tok/s | 64,35 ms |
TTFT
Für diesen Lauf nicht gemessen.
Kontextlänge
Für diesen Lauf nicht gemessen.
Parallelität
Parallelität · Gesamtdurchsatz
Beobachtete Rohwerte · Mediane separat in der Tabelle.Werte je Anfrage stehen im Rohbezug.
Kategorische Achse · gleiche Abstände zwischen Messpunkten.
| Messpunkt | C | OSL | Rohwert | TTFT |
|---|---|---|---|---|
| C=1 | 1 | 128 | 38,56 tok/s | 64,35 ms |
| C=2 | 2 | 128 | 76,59 tok/s | 59,95 ms |
| C=4 | 4 | 128 | 122,48 tok/s | 75,83 ms |
| C=8 | 8 | 128 | 240,78 tok/s | 837,85 ms |
| C=16 | 16 | 128 | 398,56 tok/s | 207,22 ms |
| C=32 | 32 | 128 | 723,52 tok/s | 369,67 ms |
| C=64 | 64 | 128 | 1.453,8 tok/s | 600,66 ms |
| C=128 | 128 | 128 | 2.005,03 tok/s | 1.079,7 ms |
| C=256 | 256 | 128 | 2.826,59 tok/s | 2.075,99 ms |
| C=512 | 512 | 128 | 2.854,88 tok/s | 5.626,82 ms |
| C=1.024 | 1.024 | 128 | 2.999,35 tok/s | 13.149,65 ms |
Rohbezug und vollständige Workload-Angaben
Statistik nur aus expliziten Angaben. Fehlende Statistik bleibt nicht gemessen.
| Messpunkt | ISL | OSL | Kontext | C | Aggregate decode | Per-request decode | TTFT |
|---|---|---|---|---|---|---|---|
| C=1 | 128 | 128 | 16.384 | 1 | 38,56 tok/s | 38,56 tok/s | 64,35 ms |
| C=2 | 128 | 128 | 16.384 | 2 | 76,59 tok/s | 38,59 tok/s | 59,95 ms |
| C=4 | 128 | 128 | 16.384 | 4 | 122,48 tok/s | 38,13 tok/s | 75,83 ms |
| C=8 | 128 | 128 | 16.384 | 8 | 240,78 tok/s | 38,53 tok/s | 837,85 ms |
| C=16 | 128 | 128 | 16.384 | 16 | 398,56 tok/s | 36,55 tok/s | 207,22 ms |
| C=32 | 128 | 128 | 16.384 | 32 | 723,52 tok/s | 33,1 tok/s | 369,67 ms |
| C=64 | 128 | 128 | 16.384 | 64 | 1.453,8 tok/s | 29,05 tok/s | 600,66 ms |
| C=128 | 128 | 128 | 16.384 | 128 | 2.005,03 tok/s | 23,73 tok/s | 1.079,7 ms |
| C=256 | 128 | 128 | 16.384 | 256 | 2.826,59 tok/s | 17,07 tok/s | 2.075,99 ms |
| C=512 | 128 | 128 | 16.384 | 512 | 2.854,88 tok/s | 15,46 tok/s | 5.626,82 ms |
| C=1024 | 128 | 128 | 16.384 | 1.024 | 2.999,35 tok/s | 14,14 tok/s | 13.149,65 ms |
Benchmark-Modul · resources
Speicher, Prefix-Cache und Energie
Dateigröße, beobachteter GPU-Speicher und reservierter KV-Cache bleiben getrennt. Energie benötigt Gerät, Phase, Intervall und Quelle.
Speicher nach Phase und Gerät
Checkpoint auf Disk: Nicht gemessen
| Gerät | Idle | Post-load | KV reserviert | Peak | Quelle |
|---|---|---|---|---|---|
| Speicher | Nicht gemessen | ||||
Prefix-Cache · Cold / Warm
Ein Vergleich braucht ein passendes Cold/Warm-Paar desselben Präfixes.
- Cold
- Nicht gemessen
- Warm
- Nicht gemessen
Energie je Gerät und Intervall
- Gerät
- Nicht gemessen
- Phase
- Nicht gemessen
- Energie
- Nicht gemessen
- Leistung
- Nicht gemessen
- Dauer
- Nicht gemessen
- Quelle
- Nicht gemessen
Benchmark-Modul · evidence
Messartefakt und Nachweise
Ein Prüfreport gehört zu einem exakten Artefakt-Digest. Rohartefakt, publizierte Ableitung und Reproduktionsangaben haben unterschiedliche Rollen.
Artefakt und Prüfreport
- SHA-256
- live-capture
Rohartefakt: Nicht verfügbar
Prüfreport: unvalidated_live_capture
Reproduktion und Zuordnung
- Run-ID
- Qwen2.5-Coder-7B-Instruct-vllm-xpu-tp1-baseline
- Modellrevision
- Nicht verfügbar
- Messzeitpunkt
- 2026-09-08T14:57:51.478905+00:00
- Quelle
- Nicht verfügbar
Reproduktionsangaben: Nicht verfügbar.
Modellqualität · Vergleichskontext
Modellqualität und Quantisierung
Qualität, Durchsatz und Speicher gelten für die angegebene Modellversion, Quantisierung und Evaluationsmethode.
Evaluation auswählen
Bewertung steht noch aus. Für diesen Lauf liegen keine Evaluationsdaten vor.
- Qualität
- Nicht gemessen
- Durchsatz
- Nicht gemessen
- Speicher
- Nicht gemessen
Vergleich · drei Darstellungen
Qualität × Tempo · drei Ansichten
Drei Darstellungen derselben Qualitäts- und Durchsatzwerte. Absolute Achsen behalten ihre Einheiten; die Normierung ist nur eine Darstellungshilfe.
Bewertung steht noch aus. Für diesen Lauf liegen keine Evaluationsdaten vor.
Token-Beobachtungen
Speculative Decoding
Angefordertes und tatsächlich wirksames Verhalten sind getrennte Angaben. Ein Zähler ersetzt keine Token-Spur.
Token-Beobachtungen für diesen Lauf nicht verfügbar.
Angefordert vs. wirksam
- Angefordert
- Nicht angegeben
- Wirksam
- Nicht angegeben
- Vorgeschlagen
- Nicht gemessen
- Akzeptiert
- Nicht gemessen
- Verworfen
- Nicht gemessen
- Nicht verwendet
- Nicht gemessen
Korrektheitsfälle
Keine Korrektheitsfälle angegeben.
Token-Beobachtungen
Acceptance Map
Akzeptierte, verworfene und nach Abbruch nicht verwendete Vorschläge bleiben unterscheidbar.
Token-Beobachtungen für diesen Lauf nicht verfügbar.
Token-Beobachtungen
Token-Latenz
Die Folge zeigt einzelne Token-Ereignisse mit ihrer beobachteten Latenz. Durchsatzaggregate erzeugen keine Token-Zeitreihe.
Token-Beobachtungen für diesen Lauf nicht verfügbar.
Runde × Token
Token-Heatmap
Unabhängige Latenzbeobachtungen nach Runde und Token. Abgelehnte und nicht ausgewertete Zellen bleiben getrennt.
Für diesen Lauf nicht gemessen