Was wir testen
Common Sense
Prüft, ob ein Modell naheliegende Zusammenhänge erkennt und Antworten alltagstauglich einordnet.
Creative
Bewertet, wie gut ein Modell alternative Lösungswege, neue Perspektiven und brauchbare Formulierungen entwickelt.
Domain Expertise
Misst die fachliche Qualität bei QM-nahen Aufgaben, Normverständnis und regulatorisch sensiblen Fragestellungen.
Hallucination
Bewertet, ob das Modell Unsicherheit erkennt, keine unbelegten Aussagen erfindet und Grenzen sauber benennt.
Pattern Recognition
Prüft, ob Muster, Abweichungen, Zusammenhänge und wiederkehrende Problemstrukturen zuverlässig erkannt werden.
Reasoning
Bewertet logisches Schließen, strukturierte Herleitung und belastbare Entscheidungsvorbereitung.
Sycophancy
Misst, ob ein Modell falschen Annahmen widerspricht, statt Nutzern unkritisch zuzustimmen.
Translation
Bewertet Übersetzungsqualität, Begriffstreue und konsistente Übertragung fachlicher Inhalte.
Unsere Top 10 LLMs aus 36 getesteten Modellen
Stand: 31.07.2026
|
1
|
Fable_5
Claude, Anthropic
|
4.97/5 |
|
2
|
Kimi_K3_OW
Kimi, Moonshot AI
|
4.61/5 |
|
3
|
Opus_4.6
Claude, Anthropic
|
4.58/5 |
|
4
|
Grok_4.5
Grok, xAI
|
4.58/5 |
|
5
|
Opus_5
Claude, Anthropic
|
4.55/5 |
|
6
|
MiniMax_M3_OW
MiniMax, MiniMax
|
4.52/5 |
|
7
|
Terra_5.6
ChatGPT, OpenAI
|
4.48/5 |
|
8
|
Inkling_OW
Inkling, Thinking Machines
|
4.48/5 |
|
9
|
Sol_5.6
ChatGPT, OpenAI
|
4.45/5 |
|
10
|
Sonnet_5
Claude, Anthropic
|
4.39/5 |
Skala: 0 bis 5 Punkte. Gesamtwertung aus Common Sense, Creative, Domain Expertise, Hallucination, Pattern Recognition, Reasoning, Sycophancy und Translation.
Hinweis: Die Rangfolge bewertet die fachliche Modellleistung auf Basis ausgewählter Testfälle und Fähigkeitsdimensionen. Sie ersetzt keine unternehmensspezifische Modell-, Datenschutz-, Risiko- oder Compliancebewertung.

