Apertus
Mehrsprachige, in der Schweiz entwickelte Kandidaten für gesteuertes RAG, Dokumente und Multimodalität, wenn lokale Herkunft zählt.
Einsatz: vertrauliche Archive, mehrsprachiges Retrieval, kompakte und grosse Knoten.
Open-Model-Programm · geprüft 29. Juli 2026
ANULUM evaluiert ernsthafte Open-Source- und Open-Weight-Kandidaten für kompakte Knoten, professionelle Systeme und Rack-Infrastruktur. Kimi K3 ist die aktuelle Open-Weight-Flaggschiff-Referenz für maximale Fähigkeit—nicht die automatische Antwort auf jede Arbeitslast.
Open Source verwenden wir nur, wenn Artefakte und Bedingungen der exakten Version diese Bezeichnung tragen. Open Weight bedeutet, dass Gewichte unter benannten Bedingungen verfügbar sind; diese können individuell, zugangsbeschränkt oder nutzungsbeschränkt sein. Jedes Mandat prüft Checkpoint, Lizenzversion, Einsatzzweck und Weitergabepfad.
Katalogregel: Aufnahme bedeutet «evaluationswürdig», nicht «empfohlen», «sicher», «konform» oder «produktionsreif». Drittanbieter-Quantisierungen folgen erst nach Herkunfts- und Integritätsprüfung.
Breit genug gegen Lock-in, begrenzt genug für prüfbare Quellen.
Mehrsprachige, in der Schweiz entwickelte Kandidaten für gesteuertes RAG, Dokumente und Multimodalität, wenn lokale Herkunft zählt.
Einsatz: vertrauliche Archive, mehrsprachiges Retrieval, kompakte und grosse Knoten.
Reasoning, Tool-Nutzung und forschungstransparente oder permissiv lizenzierte Pfade in sehr verschiedenen Systemgrössen.
Einsatz: Agenten, Reasoning, Coding, Langkontext und kontrollierte Forschung.
Kleinere Familien für Dokumentextraktion, lokale Assistenten, Vision und kostensensible private Bereitstellung.
Einsatz: OCR, Klassifikation, Büroabläufe, Edge und Einzelknoten.
Multimodale und agentische Kandidaten zwischen professionellen Mehr-GPU-Systemen und Rack-Klasse.
Einsatz: mehrsprachige Assistenten, visuelle Dokumente, Tools und höhere Parallelität.
Zweckgeformte Kandidaten gehören in Spezialspuren, statt unbemerkt zum Standardmodell zu werden.
Einsatz: Software Engineering, Policy-Prüfung, Guardrails und enge Automation.
Offizielle Gewichte und Serving-Anleitungen machen K3 zum glaubwürdigen souveränen Evaluationskandidaten für maximale Fähigkeit. Es bleibt ein Rack-Programm mit kundenspezifischen Gates.
Messen: Retrieval-Recall, Behauptungsbeleg, Zitatkorrektheit, Enthaltung und Prüfzeit auf einem eingefrorenen Dokumentsatz.
Messen: Sachfehler, Instruktionstreue, Quellentreue, Schwärzungsverhalten und menschlicher Korrekturaufwand.
Messen: zurückgehaltene Aufgaben, Testquote, Tool-Schema, Berechtigungen, Rollback und Vollständigkeit der Belege.
Messen: OCR- und Tabellengenauigkeit, Layout-Verankerung, bildgestützte Aussagen und sichtbare Fehler in realen Formaten.
Messen: Deutsch, Englisch, Französisch und Italienisch, Terminologiestabilität, Entitäten und Zitatgenauigkeit.
Messen: Zeit bis zum ersten Token, Durchsatz, Parallelität, Speicher, Kontextkosten, Energie und Wiederanlauf auf dem deklarierten System.
Score-Status
Offizielle Model Cards und Berichte belegen herstellerberichtete Benchmarks. ANULUM publiziert Messwerte nur mit Checkpoint-Hash, Engine und Einstellungen, deklarierter Hardware, Datensatz- oder Aufgabenversion, Laufprotokoll und Abnahmeschwelle.
Quellen geprüft am 29. Juli 2026. Modellbestände und Bedingungen ändern sich; Checkpoint und Lizenz werden bei Mandatsbeginn erneut geprüft.
Beginnen Sie mit Arbeitslast, Verwahrungsgrenze, Sprachen, Latenzziel und der Hardware, die Sie betreiben wollen.