Nachweisnotiz · geprüft am 29. Juli 2026


Modellgewichte sind nur die Speicheruntergrenze.

Eine Gewichtsberechnung kann einen unmöglichen Plan verwerfen. Sie belegt allein nicht, dass Kontext und Parallelität bedient werden.

Die Serving-Hülle

01GewichteParameter × Präzision
02RuntimeKernel und Puffer
03KV-CacheKontext × Benutzer
04ReserveStabilität und Spitzen
05Testexakte Engine und Last

Gesamtparameter bestimmen bei Mixture-of-Experts die residenten Gewichte, auch wenn pro Token weniger aktiv sind. Quantisierung verändert Speicher und möglicherweise Qualität oder Runtime. Langer Kontext und parallele Sitzungen können die Restkapazität dominieren.

Berechnen zum Planen; messen zum Behaupten.

  • transparente Untergrenze aus dem exakten Checkpoint
  • Präzision, Engine, Kontext, Batch und Parallelität deklarieren
  • explizite Reserve statt nominale Kapazität füllen
  • Qualität, Latenz, Durchsatz und Strom am Zielsystem messen

Nachweisgrenze: Berechneter Speicher ist kein Produktionsbenchmark und keine Fit-Garantie.

Hardware-Fit-Instrument öffnen →

Schätzung in einen Abnahmetest verwandeln.

Benchmarkmethode prüfen