Open-Model-Programm · geprüft 29. Juli 2026


Das stärkste Modell, das zur Grenze passt.

ANULUM evaluiert ernsthafte Open-Source- und Open-Weight-Kandidaten für kompakte Knoten, professionelle Systeme und Rack-Infrastruktur. Kimi K3 ist die aktuelle Open-Weight-Flaggschiff-Referenz für maximale Fähigkeit—nicht die automatische Antwort auf jede Arbeitslast.

Offizielle QuellenSystemeignungANULUM-Score ausstehend
01Lizenz und Gewichtsverwahrung02Aufgaben- und Spracheignung03Hardware und Betrieb04Gemessene Abnahme

Open Source und Open Weight sind keine Synonyme.

Open Source verwenden wir nur, wenn Artefakte und Bedingungen der exakten Version diese Bezeichnung tragen. Open Weight bedeutet, dass Gewichte unter benannten Bedingungen verfügbar sind; diese können individuell, zugangsbeschränkt oder nutzungsbeschränkt sein. Jedes Mandat prüft Checkpoint, Lizenzversion, Einsatzzweck und Weitergabepfad.

Katalogregel: Aufnahme bedeutet «evaluationswürdig», nicht «empfohlen», «sicher», «konform» oder «produktionsreif». Drittanbieter-Quantisierungen folgen erst nach Herkunfts- und Integritätsprüfung.

Aktuelle gesteuerte Kandidatenfamilien

Breit genug gegen Lock-in, begrenzt genug für prüfbare Quellen.

Detaillierten Katalog prüfen →
Schweizer Option

Apertus

Mehrsprachige, in der Schweiz entwickelte Kandidaten für gesteuertes RAG, Dokumente und Multimodalität, wenn lokale Herkunft zählt.

Einsatz: vertrauliche Archive, mehrsprachiges Retrieval, kompakte und grosse Knoten.

Permissive Kandidaten

gpt-oss · OLMo · DeepSeek V4

Reasoning, Tool-Nutzung und forschungstransparente oder permissiv lizenzierte Pfade in sehr verschiedenen Systemgrössen.

Einsatz: Agenten, Reasoning, Coding, Langkontext und kontrollierte Forschung.

Kompakt multimodal

Gemma · Qwen · Granite · Ministral

Kleinere Familien für Dokumentextraktion, lokale Assistenten, Vision und kostensensible private Bereitstellung.

Einsatz: OCR, Klassifikation, Büroabläufe, Edge und Einzelknoten.

Grosse Generalisten

Mistral Small 4 · Llama 4 · GLM

Multimodale und agentische Kandidaten zwischen professionellen Mehr-GPU-Systemen und Rack-Klasse.

Einsatz: mehrsprachige Assistenten, visuelle Dokumente, Tools und höhere Parallelität.

Spezialisten

Devstral · Kimi Code · Granite Guardian

Zweckgeformte Kandidaten gehören in Spezialspuren, statt unbemerkt zum Standardmodell zu werden.

Einsatz: Software Engineering, Policy-Prüfung, Guardrails und enge Automation.

Flaggschiff-Referenz

Kimi K3

Offizielle Gewichte und Serving-Anleitungen machen K3 zum glaubwürdigen souveränen Evaluationskandidaten für maximale Fähigkeit. Es bleibt ein Rack-Programm mit kundenspezifischen Gates.

K3-Evaluation öffnen →

Den Anwendungsfall benchmarken, nicht die Marke.

Belegte Archivantworten

Messen: Retrieval-Recall, Behauptungsbeleg, Zitatkorrektheit, Enthaltung und Prüfzeit auf einem eingefrorenen Dokumentsatz.

Professionelle Entwürfe

Messen: Sachfehler, Instruktionstreue, Quellentreue, Schwärzungsverhalten und menschlicher Korrekturaufwand.

Coding und Agenten

Messen: zurückgehaltene Aufgaben, Testquote, Tool-Schema, Berechtigungen, Rollback und Vollständigkeit der Belege.

Multimodale Dokumente

Messen: OCR- und Tabellengenauigkeit, Layout-Verankerung, bildgestützte Aussagen und sichtbare Fehler in realen Formaten.

Mehrsprachige Schweizer Arbeit

Messen: Deutsch, Englisch, Französisch und Italienisch, Terminologiestabilität, Entitäten und Zitatgenauigkeit.

Systemleistung

Messen: Zeit bis zum ersten Token, Durchsatz, Parallelität, Speicher, Kontextkosten, Energie und Wiederanlauf auf dem deklarierten System.

Score-Status

Herstellerresultate sind Nachweise—keine ANULUM-Resultate.

Offizielle Model Cards und Berichte belegen herstellerberichtete Benchmarks. ANULUM publiziert Messwerte nur mit Checkpoint-Hash, Engine und Einstellungen, deklarierter Hardware, Datensatz- oder Aufgabenversion, Laufprotokoll und Abnahmeschwelle.

Benchmark-Vertrag lesen →

Aus der Auswahl eine belastbare Shortlist machen.

Beginnen Sie mit Arbeitslast, Verwahrungsgrenze, Sprachen, Latenzziel und der Hardware, die Sie betreiben wollen.

Modellevaluation anfragen Modellkatalog öffnen →