In meinen KI-Kursen sehe ich inzwischen regelmäßig sehr gute Ergebnisse, bei denen ich aus dem Ergebnis allein kaum noch ablesen kann, was die Person dahinter verstanden hat. Ein Text ist sauber strukturiert, die Argumentation wirkt schlüssig und die Präsentation sieht ordentlich aus. Das kann gute Arbeit sein. Es kann aber auch ein nahezu unbearbeiteter KI-Output sein.

Genau hier liegt das Problem klassischer Prüfungen. Wenn generative KI einen professionell wirkenden Output in wenigen Minuten erzeugt, verliert das Endprodukt als alleiniger Leistungsnachweis an Aussagekraft. Für die Bewertung wird der Weg zum Ergebnis wichtiger: Wie wurde die Aufgabe eingegrenzt? Welche Quellen wurden geprüft? Wo wurde der erste Vorschlag verworfen? Welche Fehler hat die Person erkannt und korrigiert?

Ich bewerte deshalb in KI-Prüfungen den Arbeitsprozess deutlich stärker als früher. Das macht Prüfungen nicht automatisch einfacher. Es macht sichtbarer, ob jemand ein System bedienen kann oder die eigene Arbeit tatsächlich versteht.

Infografik zur Bewertung von KI-Prüfungen: Prozess und Reflexion statt nur des fertigen Outputs
Bei KI-Prüfungen macht der dokumentierte Arbeitsprozess Kompetenz sichtbar.

Warum ein guter KI-Output wenig über Kompetenz verrät

Ein aktueller Preprint mit dem Titel „Your Students Don’t Use LLMs Like You Wish They Did“ hat 12.650 Nachrichten aus 500 Gesprächen zwischen Studierenden und KI-Systemen untersucht. Die Forschenden fanden eine deutliche Lücke zwischen pädagogischer Absicht und tatsächlicher Nutzung. Viele Studierende verwendeten die Systeme vor allem, um Antworten zu erhalten. Exploratives Lernen kam wesentlich seltener vor.

Das überrascht mich nicht. Unter Zeitdruck optimieren Menschen auf das, was bewertet wird. Wenn am Ende nur das fertige Dokument zählt, liegt es nahe, die KI genau dafür einzusetzen. Ein aufwendig formulierter Arbeitsauftrag ändert daran wenig, solange das Bewertungssystem denselben alten Anreiz setzt.

Für Lehrende entsteht dadurch ein Messproblem. Sie sehen ein Ergebnis, aber nicht, ob die Person die fachlichen Annahmen geprüft, Alternativen abgewogen oder offensichtliche Halluzinationen übersehen hat. Gerade diese Fähigkeiten gehören für mich zur wichtigsten KI-Kompetenz: Urteilsvermögen.

KI verbieten löst nur einen Teil der Aufgabe

Es gibt Situationen, in denen ich wissen muss, was jemand ohne Hilfsmittel beherrscht. Grundbegriffe, fachliche Zusammenhänge und sicherheitsrelevantes Wissen lassen sich in kurzen beaufsichtigten Aufgaben prüfen. Solche Kompetenzchecks behalten ihren Wert.

Genauso wichtig sind Aufgaben, in denen KI ausdrücklich erlaubt ist. Sie bilden eher ab, wie Menschen später im Beruf arbeiten. Dann gehört die Nutzung des Werkzeugs zur Leistung, muss aber nachvollziehbar werden. Die australische Hochschulbehörde TEQSA empfiehlt in ihren Leitlinien zur Prüfungsreform ebenfalls, abgesicherte Leistungsnachweise mit authentischen, KI-gestützten Aufgaben zu verbinden und Prüfungen auf Programmebene zu betrachten.

Für meine Prüfungen bedeutet das eine klare Trennung:

  • Kompetenzcheck ohne KI: Kann die Person zentrale Begriffe erklären, Zusammenhänge herstellen und fachliche Entscheidungen begründen?
  • Praxisaufgabe mit KI: Kann die Person ein reales Problem strukturieren, geeignete Werkzeuge auswählen, Ergebnisse prüfen und die Qualität durch mehrere Iterationen verbessern?

Diese Trennung nimmt auch den Druck aus der Grundsatzdiskussion. Nicht jede Prüfung muss KI zulassen. Nicht jede Prüfung sollte so tun, als gäbe es KI im späteren Arbeitsalltag nicht.

Warum KI-Detektoren keine faire Abkürzung sind

Die naheliegende technische Antwort lautet oft: Dann prüfen wir eben, ob ein Text von einer KI stammt. Darauf würde ich keine Bewertung aufbauen.

KI-Detektoren berechnen Wahrscheinlichkeiten anhand sprachlicher Muster. Sie können weder die Entstehung eines Textes sicher rekonstruieren noch beweisen, welche Passagen von wem stammen. Eine in der Fachzeitschrift Patterns veröffentlichte Untersuchung zeigte zudem, dass solche Systeme Texte von Menschen, die Englisch nicht als Muttersprache sprechen, überdurchschnittlich häufig fälschlich als KI-generiert einstuften. Für eine Prüfung mit realen Konsequenzen ist das ein erhebliches Fairnessproblem.

Ein Prozessnachweis ist aussagekräftiger. Er liefert positive Belege für eine Leistung: Entscheidungen, Quellenprüfungen, verworfene Varianten und fachliche Korrekturen. Lehrende müssen dann weniger über die Urheberschaft eines glatten Textes spekulieren.

Was bei einer KI-Prüfung bewertet werden sollte

Ich möchte erkennen können, ob jemand planvoll mit dem System gearbeitet hat. Dafür müssen Studierende nicht jeden einzelnen Chat exportieren. Ein endloses Prompt-Protokoll erzeugt vor allem viel Lesearbeit. Sinnvoller ist ein knapper Nachweis der relevanten Entscheidungen.

Diese sieben Bereiche decken den Prozess in der Praxis gut ab:

BewertungsbereichAnteilWoran ich Leistung erkenne
Aufgabenverständnis und Eingrenzung15 %Ziel, Rahmenbedingungen und Qualitätskriterien sind klar formuliert.
Recherche und Quellen15 %Quellen sind passend ausgewählt, überprüft und korrekt eingeordnet.
Werkzeug- und Promptwahl10 %Die gewählte Vorgehensweise passt zur Aufgabe und wird begründet.
Prüfung und Fehleranalyse20 %Falsche, unbelegte oder ungeeignete Aussagen werden erkannt und korrigiert.
Entscheidungen und Iteration20 %Änderungen zwischen den Versionen sind nachvollziehbar und fachlich begründet.
Reflexion und Transfer10 %Grenzen der Lösung werden benannt und Erkenntnisse auf neue Fälle übertragen.
Qualität des Endergebnisses10 %Das Resultat erfüllt den Auftrag und ist für die Zielgruppe brauchbar.

Die Gewichtung ist kein allgemeingültiges Gesetz. Bei einer gestalterischen Aufgabe kann das Endergebnis stärker zählen, bei einer Recherche die Quellenprüfung. Wichtig ist, dass der reine Output nicht mehr automatisch den größten Anteil bekommt.

Ein Beispiel für eine prüfbare KI-Aufgabe

Eine Aufgabe aus dem Marketing könnte lauten: Entwickle mit Unterstützung generativer KI ein Kampagnenkonzept für ein erklärungsbedürftiges Weiterbildungsangebot. Berücksichtige Zielgruppe, Nutzenversprechen, Kanäle und drei konkrete Inhalte.

Abgegeben werden vier Bestandteile:

  1. das fertige Kampagnenkonzept,
  2. eine kurze Dokumentation des ersten Ansatzes und zweier wesentlicher Überarbeitungen,
  3. ein Beispiel für einen verworfenen KI-Vorschlag mit Begründung,
  4. eine fünfminütige mündliche Verteidigung der wichtigsten Entscheidungen.

Die mündliche Verteidigung ist dabei kein Verhör. Meist reichen wenige präzise Nachfragen: Warum wurde diese Zielgruppe gewählt? Welche Aussage musste überprüft werden? Was hat sich zwischen Version eins und drei verbessert? Wer den Prozess selbst gesteuert hat, kann solche Fragen konkret beantworten.

Aufgaben dieser Art passen zu dem, was eine gute KI-Schulung heute vermitteln sollte. Promptvorlagen allein tragen nicht weit. Fachwissen, Quellenkritik, Fehlererkennung und die Fähigkeit zur Überarbeitung machen aus einem KI-Output ein belastbares Arbeitsergebnis.

Wie der Arbeitsprozess sichtbar wird, ohne Bürokratie zu erzeugen

Eine Prozessbewertung kann schnell ausufern. Wenn Studierende dutzende Screenshots, komplette Chatverläufe und lange Reflexionsberichte abgeben sollen, verschiebt sich die Arbeit vom Lernen zur Dokumentation. Ich versuche deshalb, nur Belege anzufordern, die für die Bewertung tatsächlich etwas zeigen.

  • Der erste Prompt zeigt, wie die Aufgabe verstanden wurde.
  • Eine wichtige Zwischenversion zeigt, wo nachgesteuert wurde.
  • Ein verworfener Vorschlag zeigt Urteilsvermögen.
  • Eine Quellenprüfung zeigt, ob Aussagen abgesichert wurden.
  • Eine kurze Selbstkritik zeigt, ob die Grenzen des Ergebnisses verstanden wurden.

Das lässt sich auf einer Seite oder in einer kleinen Tabelle dokumentieren. Gute Kriterien sollten vor der Aufgabe bekannt sein. Wer erst nach der Abgabe erfährt, dass Iterationen und Fehleranalyse wichtig waren, wurde nicht fair geprüft.

Was Unternehmen daraus für Weiterbildung ableiten können

Das Thema endet nicht an der Hochschule. Auch in Unternehmen wird KI-Kompetenz häufig über eine Demo oder einen gelungenen Beispieltext beurteilt. Das ist dünn. Im Arbeitsalltag zählt, ob jemand mit vertraulichen Daten richtig umgeht, Quellen prüft, fachliche Fehler erkennt und Ergebnisse an reale Anforderungen anpasst.

Für interne Schulungen und Zertifizierungen lohnt sich deshalb dasselbe Prinzip: Eine kurze Wissensprüfung sichert Grundlagen ab. Eine Praxisaufgabe zeigt, wie die Person mit KI arbeitet. Ein Gespräch über Entscheidungen macht sichtbar, ob der Prozess verstanden wurde.

Diese Fähigkeiten gehören zu den Future Skills für die Arbeit mit KI. Wer sie systematisch entwickeln will, braucht Aufgaben, Feedback und Wiederholung. In meinen KI-Kursen und Weiterbildungen steht deshalb die praktische Arbeit mit realen Fällen im Mittelpunkt.

Was ich am Ende sehen will

Ein perfekter erster Output beeindruckt mich weniger als ein nachvollziehbarer dritter. In den Unterschieden zwischen beiden Versionen steckt meist die eigentliche Leistung. Dort sehe ich, ob jemand eine Schwäche erkannt, eine Quelle überprüft, eine falsche Richtung verlassen oder eine Entscheidung fachlich begründet hat.

Der Output bleibt Teil der Prüfung. Er liefert den Gegenstand, an dem sich die Reflexion prüfen lässt. Die Kompetenz zeigt sich darin, wie bewusst jemand zu diesem Ergebnis gekommen ist und ob die Person es auch ohne die glatte Oberfläche des KI-Textes erklären kann.

Quellen