WebDrift

DIGITALE SYSTEME WERDEN GELADEN

BLOG · KI-NEWS & MODELLE

Neues KI-Modell bewerten: So testen Sie es an einem Nachmittag

Ein neues KI-Modell in einem Nachmittag bewerten: zehn eigene Testaufgaben, blinde Bewertung, Kosten, Tempo, Datenbedingungen und typische Fehlerbilder.

4 Min. Lesezeit

Von WebDrift RedaktionRead in English

Ein Prüfstand mit einem leuchtenden Würfel unter einer Lupe und einer Bewertungskarte in einem dunklen LaborKI-News & Modelle

Ein neues KI-Modell bewerten Sie an einem Nachmittag mit einem eigenen Testsatz aus etwa zehn echten Aufgaben, blinder Bewertung und einem Blick auf Kosten, Tempo, Datenbedingungen und typische Fehler. Benchmarks und Ranglisten sagen wenig darüber, wie ein Modell bei Ihren Aufgaben abschneidet. Ein kleiner, wiederholbarer Test schon.

Wie sieht der Nachmittag aus?

Der Plan passt in vier bis fünf Stunden. Sie brauchen dafür keine Programmierkenntnisse, aber jemanden, der Ihre Aufgaben kennt.

ZeitSchrittErgebnis
30 MinutenZiel und Erfolgskriterien festlegenEine Seite: Aufgabe, Qualitätsmaßstab, Muss-Kriterien
60 MinutenZehn Testaufgaben sammeln und erwartete Ergebnisse notierenTestsatz mit Bewertungsraster
60 MinutenJede Aufgabe mit Kandidat und bisherigem Modell ausführenAntworten, mehrfach je Aufgabe
45 MinutenBlind bewertenPunkte je Aufgabe und Kriterium
30 MinutenKosten, Tempo und Datenbedingungen prüfenVergleichstabelle
30 MinutenEntscheidung und DokumentationWechseln, behalten oder Pilot

Wie stellen Sie einen guten Testsatz zusammen?

Wählen Sie Aufgaben, die in Ihrem Alltag wirklich vorkommen: eine Kundenantwort, eine Zusammenfassung, das Herausziehen von Angaben aus einem Text. Nehmen Sie sechs bis sieben typische Fälle, zwei schwierige Sonderfälle und ein bis zwei Fallen, bei denen das Modell zugeben sollte, dass es etwas nicht weiß. Notieren Sie für jede Aufgabe, wie eine gute Antwort aussieht.

Anonymisieren Sie alle Beispiele. Kundennamen, Adressen und vertrauliche Zahlen gehören nicht in einen Test, solange Vertrag und Datenschutz nicht geklärt sind. Wie Sie Modelle grundsätzlich auswählen, beschreibt Claude, ChatGPT oder Gemini im Unternehmen.

Wie bewerten Sie fair?

Geben Sie allen Kandidaten dieselbe Anweisung und dieselben Unterlagen. Lassen Sie jede Aufgabe zwei- bis dreimal laufen, weil Antworten schwanken. Verdecken Sie, welches Modell welche Antwort erzeugt hat, und vergeben Sie Punkte von eins bis fünf für Richtigkeit, Vollständigkeit, Ton und Format. Die Dokumentationen der Anbieter beschreiben das Vorgehen ausführlicher, etwa Anthropic zum Entwickeln von Tests und OpenAI zu Evals.

Was gehört außer der Qualität noch in den Vergleich?

Kosten, Tempo und Datenbedingungen entscheiden oft mehr als kleine Qualitätsunterschiede. Zählen Sie die verarbeiteten Tokens und rechnen Sie mit den aktuellen Preisen des Anbieters auf Ihre erwartete Monatsmenge hoch. Messen Sie die Antwortzeit. Klären Sie, ob Eingaben gespeichert oder zum Training genutzt werden, wo die Verarbeitung stattfindet und ob ein Vertrag zur Auftragsverarbeitung besteht.

Achten Sie besonders auf Fehlerbilder: erfundene Fakten, missachtete Vorgaben, schwankendes Format, unbegründete Ablehnungen und Informationen, die bei langen Texten verloren gehen. Zu Halluzinationen lesen Sie KI-Halluzinationen: Was sie sind und wie Sie Ihr Unternehmen schützen. Grundlagen zur Funktionsweise liefert Was ist ein LLM?.

  • Ziel und Muss-Kriterien auf einer Seite festgehalten
  • Zehn anonymisierte Testaufgaben mit erwarteten Ergebnissen gesammelt
  • Jede Aufgabe mit Kandidat und bisherigem Modell mehrfach ausgeführt
  • Antworten blind bewertet, Fehler notiert
  • Kosten, Tempo und Datenbedingungen verglichen
  • Entscheidung mit Begründung dokumentiert
  • Termin für die nächste Überprüfung gesetzt

Wie entscheiden Sie am Ende?

Legen Sie vorab fest, was als Wechselgrund gilt: zum Beispiel, dass das neue Modell bei den Muss-Kriterien nicht schlechter sein darf und in mindestens einem Bereich spürbar besser oder günstiger ist. Gleichstand spricht für das Bisherige, denn ein Wechsel kostet Zeit für Anpassung und Schulung. Starten Sie bei einem Wechsel mit einem kleinen Pilot, etwa einer Aufgabe und zwei Personen, und vergleichen Sie nach vier Wochen mit den Ausgangswerten. Dokumentieren Sie Entscheidung, Testsatz und Datum, dann lässt sich die nächste Bewertung in wenigen Stunden wiederholen.

Fazit: Eigener Test statt Rangliste

Ein wiederholbarer Testsatz ist die beste Versicherung gegen Modellhype. Wenn Sie ihn einmal aufgebaut haben, bewerten Sie jede neue Version in wenigen Stunden. Wenn Sie Hilfe beim Testsatz oder bei der Einführung möchten, sehen Sie sich unsere KI-Automatisierung an oder schildern Sie uns Ihre Aufgaben.

Quellen

#KI-Modell bewerten#Testaufgaben#Modellvergleich#Kosten#Datenschutz#Qualitätssicherung

HÄUFIGE FRAGEN

Kurz beantwortet.

01Reichen zehn Testaufgaben wirklich aus?
Für eine erste Entscheidung ja. Zehn echte Aufgaben zeigen Stärken und Schwächen deutlicher als Ranglisten. Vor einem breiten Einsatz sollten Sie den Test mit mehr Beispielen wiederholen.
02Darf ich echte Kundendaten für den Test nutzen?
Nur, wenn Datenschutz und Vertrag das abdecken. Im Zweifel anonymisieren Sie die Beispiele oder erfinden vergleichbare. Das ist keine Rechtsberatung.
03Wie vergleiche ich Modelle fair?
Geben Sie allen Kandidaten dieselbe Anweisung und dieselben Unterlagen, bewerten Sie die Antworten ohne zu wissen, welches Modell sie erzeugt hat, und lassen Sie jede Aufgabe mehrfach laufen.
04Wie messe ich die Kosten?
Zählen Sie die verarbeiteten Tokens für Ihre Testaufgaben und rechnen Sie mit den Preisen des Anbieters auf Ihre erwartete Menge hoch. Preisangaben ändern sich; prüfen Sie die aktuelle Seite.
05Wie oft sollte ich testen?
Bei jedem Modellwechsel und regelmäßig, zum Beispiel halbjährlich. Mit festem Testsatz kostet eine Wiederholung nur Stunden.

ÜBER DIE REDAKTION

WebDrift Redaktion

Die WebDrift Redaktion ist das Team hinter WebDrift in Dresden für Entwicklung, Design, KI-Automatisierung und Sichtbarkeit. Wir schreiben über das, was wir täglich für kleine und mittlere Unternehmen bauen: ehrlich, praxisnah und ohne erfundene Zahlen.