Apertus v1.5 8B
Schweizerisch, mehrsprachig und kompakt, mit Text-, Bild- und Audioeingabe. Ein Kandidat für kontrolliertes RAG nach konkreter Aufgaben-Evaluation.
Modell-Intelligenz
Ein Modell ist erst bereitstellbar, wenn Gewichte, Lizenz, Serving-Engine, Speicherbedarf und Verhalten zusammenpassen. Dieser Katalog trennt diese Fakten — und datiert jede Aussage.
Filtern Sie nach dem System, das Sie besitzen wollen — nicht nach einer Ranglisten-Schlagzeile.
12 Modelle angezeigt
Schweizerisch, mehrsprachig und kompakt, mit Text-, Bild- und Audioeingabe. Ein Kandidat für kontrolliertes RAG nach konkreter Aufgaben-Evaluation.
Ein Schweizer Grossmodell-Kandidat mit Text-, Bild- und Audioeingabe; multimodale und lange Kontexte müssen gemessen werden.
Kompakter Kandidat für Reasoning und Werkzeuge. Aktive Parameter beeinflussen Rechenlast, nicht die volle Gewichtsresidenz.
Der offizielle 80-GB-Fit ist keine Mehrbenutzer-Leistungszusage. Parallelität wird separat gemessen.
Eine kompakte multimodale Option für Dokument- und Bildaufgaben, abhängig von Quantisierung und Kontext-Evaluation.
Interessant für Archive mit langem Kontext. Publizierte Cache- und Latenzvorteile bleiben Hersteller-/Forschungsevidenz, bis wir sie messen.
Trotz 32B aktiven Parametern Rack-Klasse: Expertengewichte bleiben resident. Der offizielle Deployment Guide ist der Anker.
Multimodal und speichereffizienter als FP8, aber weiterhin ein Multi-GPU-System mit nachzuweisendem Kontext und Durchsatz.
Ein aktueller multimodaler Checkpoint mit Bildeingabe. Lokales Video wird nicht behauptet: Die offizielle Model Card bezeichnet es als experimentell und API-exklusiv.
Ein Coding-Agent-Derivat mit erhaltenen Reasoning-Spuren und Bildeingabe. Es wird als Spezialist evaluiert, nicht als Standardmodell für Archive vorausgesetzt.
Ein grosser MoE-Kandidat, wenn Modelllizenz und validierter Multi-GPU-Stack zur Governance-Grenze passen.
Wir bewerben K3 nicht als On-Prem-Modell. Erst offizielle Gewichte, Lizenz, Hashes, Engine-Support und Benchmark begründen eine Eignung.
Der Name Kimi umfasst sehr verschiedene Realitäten. Linear kann quantisiert auf einen professionellen Node passen. K2 bis K2.7 sind Grosssystemprogramme mit unterschiedlichen allgemeinen, multimodalen und Coding-Rollen. K3 bleibt ein Beobachtungspunkt und kein autorisierter lokaler Deployment-Claim.
Parameter-Ehrlichkeit: Aktive Parameter schätzen Rechenarbeit pro Token. Residente Gesamtgewichte, KV-Cache, Runtime-Puffer, Kontext und Parallelität bestimmen den Speicher.
Ein Quellenlink ist keine ANULUM-Qualitätsempfehlung. Die Modellwahl folgt der Evaluation an Aufgaben und Randbedingungen des Kunden.
Wir testen Kandidaten gegen Ihre Dokumente, Sprache, Verweigerungsregeln und Infrastrukturgrenze.