Nachweisnotiz · geprüft am 29. Juli 2026
Modellgewichte sind nur die Speicheruntergrenze.
Eine Gewichtsberechnung kann einen unmöglichen Plan verwerfen. Sie belegt allein nicht, dass Kontext und Parallelität bedient werden.
Die Serving-Hülle
01GewichteParameter × Präzision
→02RuntimeKernel und Puffer
→03KV-CacheKontext × Benutzer
→04ReserveStabilität und Spitzen
→05Testexakte Engine und Last
Gesamtparameter bestimmen bei Mixture-of-Experts die residenten Gewichte, auch wenn pro Token weniger aktiv sind. Quantisierung verändert Speicher und möglicherweise Qualität oder Runtime. Langer Kontext und parallele Sitzungen können die Restkapazität dominieren.
Berechnen zum Planen; messen zum Behaupten.
- transparente Untergrenze aus dem exakten Checkpoint
- Präzision, Engine, Kontext, Batch und Parallelität deklarieren
- explizite Reserve statt nominale Kapazität füllen
- Qualität, Latenz, Durchsatz und Strom am Zielsystem messen
Nachweisgrenze: Berechneter Speicher ist kein Produktionsbenchmark und keine Fit-Garantie.