Ein neues KI-Modell bewerten Sie an einem Nachmittag mit einem eigenen Testsatz aus etwa zehn echten Aufgaben, blinder Bewertung und einem Blick auf Kosten, Tempo, Datenbedingungen und typische Fehler. Benchmarks und Ranglisten sagen wenig darüber, wie ein Modell bei Ihren Aufgaben abschneidet. Ein kleiner, wiederholbarer Test schon.
Wie sieht der Nachmittag aus?
Der Plan passt in vier bis fünf Stunden. Sie brauchen dafür keine Programmierkenntnisse, aber jemanden, der Ihre Aufgaben kennt.
| Zeit | Schritt | Ergebnis |
|---|---|---|
| 30 Minuten | Ziel und Erfolgskriterien festlegen | Eine Seite: Aufgabe, Qualitätsmaßstab, Muss-Kriterien |
| 60 Minuten | Zehn Testaufgaben sammeln und erwartete Ergebnisse notieren | Testsatz mit Bewertungsraster |
| 60 Minuten | Jede Aufgabe mit Kandidat und bisherigem Modell ausführen | Antworten, mehrfach je Aufgabe |
| 45 Minuten | Blind bewerten | Punkte je Aufgabe und Kriterium |
| 30 Minuten | Kosten, Tempo und Datenbedingungen prüfen | Vergleichstabelle |
| 30 Minuten | Entscheidung und Dokumentation | Wechseln, behalten oder Pilot |
Wie stellen Sie einen guten Testsatz zusammen?
Wählen Sie Aufgaben, die in Ihrem Alltag wirklich vorkommen: eine Kundenantwort, eine Zusammenfassung, das Herausziehen von Angaben aus einem Text. Nehmen Sie sechs bis sieben typische Fälle, zwei schwierige Sonderfälle und ein bis zwei Fallen, bei denen das Modell zugeben sollte, dass es etwas nicht weiß. Notieren Sie für jede Aufgabe, wie eine gute Antwort aussieht.
Anonymisieren Sie alle Beispiele. Kundennamen, Adressen und vertrauliche Zahlen gehören nicht in einen Test, solange Vertrag und Datenschutz nicht geklärt sind. Wie Sie Modelle grundsätzlich auswählen, beschreibt Claude, ChatGPT oder Gemini im Unternehmen.
Wie bewerten Sie fair?
Geben Sie allen Kandidaten dieselbe Anweisung und dieselben Unterlagen. Lassen Sie jede Aufgabe zwei- bis dreimal laufen, weil Antworten schwanken. Verdecken Sie, welches Modell welche Antwort erzeugt hat, und vergeben Sie Punkte von eins bis fünf für Richtigkeit, Vollständigkeit, Ton und Format. Die Dokumentationen der Anbieter beschreiben das Vorgehen ausführlicher, etwa Anthropic zum Entwickeln von Tests und OpenAI zu Evals.
Was gehört außer der Qualität noch in den Vergleich?
Kosten, Tempo und Datenbedingungen entscheiden oft mehr als kleine Qualitätsunterschiede. Zählen Sie die verarbeiteten Tokens und rechnen Sie mit den aktuellen Preisen des Anbieters auf Ihre erwartete Monatsmenge hoch. Messen Sie die Antwortzeit. Klären Sie, ob Eingaben gespeichert oder zum Training genutzt werden, wo die Verarbeitung stattfindet und ob ein Vertrag zur Auftragsverarbeitung besteht.
Achten Sie besonders auf Fehlerbilder: erfundene Fakten, missachtete Vorgaben, schwankendes Format, unbegründete Ablehnungen und Informationen, die bei langen Texten verloren gehen. Zu Halluzinationen lesen Sie KI-Halluzinationen: Was sie sind und wie Sie Ihr Unternehmen schützen. Grundlagen zur Funktionsweise liefert Was ist ein LLM?.
- Ziel und Muss-Kriterien auf einer Seite festgehalten
- Zehn anonymisierte Testaufgaben mit erwarteten Ergebnissen gesammelt
- Jede Aufgabe mit Kandidat und bisherigem Modell mehrfach ausgeführt
- Antworten blind bewertet, Fehler notiert
- Kosten, Tempo und Datenbedingungen verglichen
- Entscheidung mit Begründung dokumentiert
- Termin für die nächste Überprüfung gesetzt
Wie entscheiden Sie am Ende?
Legen Sie vorab fest, was als Wechselgrund gilt: zum Beispiel, dass das neue Modell bei den Muss-Kriterien nicht schlechter sein darf und in mindestens einem Bereich spürbar besser oder günstiger ist. Gleichstand spricht für das Bisherige, denn ein Wechsel kostet Zeit für Anpassung und Schulung. Starten Sie bei einem Wechsel mit einem kleinen Pilot, etwa einer Aufgabe und zwei Personen, und vergleichen Sie nach vier Wochen mit den Ausgangswerten. Dokumentieren Sie Entscheidung, Testsatz und Datum, dann lässt sich die nächste Bewertung in wenigen Stunden wiederholen.
Fazit: Eigener Test statt Rangliste
Ein wiederholbarer Testsatz ist die beste Versicherung gegen Modellhype. Wenn Sie ihn einmal aufgebaut haben, bewerten Sie jede neue Version in wenigen Stunden. Wenn Sie Hilfe beim Testsatz oder bei der Einführung möchten, sehen Sie sich unsere KI-Automatisierung an oder schildern Sie uns Ihre Aufgaben.




