Performance Lab


Tokens pro Sekunde sind noch kein System-Benchmark.

Nutzer erleben Time to First Token, Lesetakt und Warteschlange. Betreiber erleben Gesamtdurchsatz, Tail-Latenz, Energie und Fehler. Compliance braucht Qualitäts- und Verweigerungsnachweise. Wir messen alle drei Perspektiven.

Nur gemessene ResultateÖffentliche Methodenbasis

Benchmark-Vertrag bauen

Erzeugen Sie das Szenario für Offerte und Abnahmetest. Das Werkzeug erzeugt ein Protokoll, keine Leistungsschätzung.

Lokales Protokollwerkzeug

Keine Auswahl, Eingabe oder Dokument verlässt diese Seite.

Protokollausgabe

System und Arbeitslast wählen.

Status öffentlicher Resultate

Wir publizieren lieber eine leere Messtabelle, als Herstellerzahlen als eigene Resultate darzustellen.

Von ANULUM gemessen
0publizierte Produktionskonfigurationen
7definierte Abnahmeszenarien
p50 + p95verlangte Latenzverteilung
Raw JSONmit jedem Resultat erforderlich

Aktuelle Grenze: Noch ist kein absoluter ANULUM-Durchsatzwert publiziert. Herstellerwerte können Planung informieren, werden aber nie als grün gemessen klassiert.

Sieben Abnahmeszenarien

Interaktiv C12K ein · 512 aus · ein Nutzer
Interaktiv C42K ein · 512 aus · vier Nutzer
Interaktiv C82K ein · 512 aus · acht Nutzer
Dokument 32K32K ein · 512 aus · zitierte Antwort
Langkontext 128K128K ein · 1K aus · ein Nutzer
RAG-2020 Chunks · Antwort + Zitate
Agent-1010 Werkzeugschritte · deterministische Aufgabe

Was jedes Resultat offenlegen muss

Exaktes Artefakt

Modellrevision und Hash, Lizenz, Quantisierung, Serving-Engine und Version.

Exakte Maschine

Beschleuniger, Speicher, CPU, RAM, Fabric, Leistungslimits, Software und Treiber.

Exakte Arbeitslast

Ein- und Ausgabelänge, Parallelität, Kalt-/Warmzustand, Sampling und Wiederholungen.

Nutzerlatenz

TTFT p50/p95 und Inter-Token-Latenz p50/p95 — nicht nur Mittelwerte.

Betreiberkapazität

Ausgabetoken/s pro Anfrage und aggregiert, Warteschlange, Fehler und Energie pro 1.000 Token.

Antwortqualität

Quellentreue, Zitatkorrektheit, Verweigerung ungestützter Aussagen und Zugriffstests.

Evidenz-Legende

KlasseBedeutungTrägt ein Kundenversprechen?
OffiziellQuellenkontrollierte Hersteller- oder Modellpublikanten-Spezifikation.Nur für die benannte Spezifikation.
GemessenANULUM-Resultat mit reproduzierbarer Konfiguration und Rohdaten.Ja, im getesteten Rahmen.
BerechnetKapazität oder Kosten aus expliziten Annahmen.Nur Planung.
ProvisorischKommerzieller oder technischer Wert vor Offerte/Validierung.Nein.

MLPerf-Inference-Dokumentation ↗

Abnahmekriterien gehören in den Vertrag.

Das Architektur-Review definiert Szenarien, Latenzgrenzen, Qualitätsgates und Evidenzartefakte der Beschaffung.

Abnahmekriterien definieren Mandatsbänder ansehen →