Performance Lab
Tokens pro Sekunde sind noch kein System-Benchmark.
Nutzer erleben Time to First Token, Lesetakt und Warteschlange. Betreiber erleben Gesamtdurchsatz, Tail-Latenz, Energie und Fehler. Compliance braucht Qualitäts- und Verweigerungsnachweise. Wir messen alle drei Perspektiven.
Benchmark-Vertrag bauen
Erzeugen Sie das Szenario für Offerte und Abnahmetest. Das Werkzeug erzeugt ein Protokoll, keine Leistungsschätzung.
Protokollausgabe
System und Arbeitslast wählen.
Status öffentlicher Resultate
Wir publizieren lieber eine leere Messtabelle, als Herstellerzahlen als eigene Resultate darzustellen.
Aktuelle Grenze: Noch ist kein absoluter ANULUM-Durchsatzwert publiziert. Herstellerwerte können Planung informieren, werden aber nie als grün gemessen klassiert.
Sieben Abnahmeszenarien
Was jedes Resultat offenlegen muss
Exaktes Artefakt
Modellrevision und Hash, Lizenz, Quantisierung, Serving-Engine und Version.
Exakte Maschine
Beschleuniger, Speicher, CPU, RAM, Fabric, Leistungslimits, Software und Treiber.
Exakte Arbeitslast
Ein- und Ausgabelänge, Parallelität, Kalt-/Warmzustand, Sampling und Wiederholungen.
Nutzerlatenz
TTFT p50/p95 und Inter-Token-Latenz p50/p95 — nicht nur Mittelwerte.
Betreiberkapazität
Ausgabetoken/s pro Anfrage und aggregiert, Warteschlange, Fehler und Energie pro 1.000 Token.
Antwortqualität
Quellentreue, Zitatkorrektheit, Verweigerung ungestützter Aussagen und Zugriffstests.
Evidenz-Legende
| Klasse | Bedeutung | Trägt ein Kundenversprechen? |
|---|---|---|
| Offiziell | Quellenkontrollierte Hersteller- oder Modellpublikanten-Spezifikation. | Nur für die benannte Spezifikation. |
| Gemessen | ANULUM-Resultat mit reproduzierbarer Konfiguration und Rohdaten. | Ja, im getesteten Rahmen. |
| Berechnet | Kapazität oder Kosten aus expliziten Annahmen. | Nur Planung. |
| Provisorisch | Kommerzieller oder technischer Wert vor Offerte/Validierung. | Nein. |