Wer heute schnell eine Information braucht, tippt sie häufiger bei ChatGPT, Gemini oder Perplexity ein als bei einer klassischen Suchmaschine. Die Antworten kommen in Sekunden, klingen kompetent und verzichten auf Werbebanner. Das ist praktisch. Aber es verführt dazu, die Grenzen dieser Systeme zu übersehen.
Wie KI-Sprachmodelle Antworten erzeugen
Sprachmodelle wie GPT-4 oder Gemini Ultra sind keine Suchmaschinen. Sie durchsuchen das Internet nicht in Echtzeit, sondern greifen auf Muster zurück, die sie während des Trainings auf riesigen Textmengen gelernt haben. Was überzeugend klingt, ist statistisch wahrscheinlich. Das bedeutet: Ein Modell kann eine inhaltlich falsche Aussage mit hoher sprachlicher Sicherheit formulieren.
Dieses Phänomen heißt Halluzination und ist kein Bug, sondern eine strukturelle Eigenschaft generativer Modelle. Das Modell „weiß“ nicht, ob eine Aussage wahr ist. Es berechnet, welche Wortfolge in einem gegebenen Kontext plausibel erscheint. Das führt dazu, dass es Studien zitiert, die nicht existieren, Jahreszahlen verwechselt oder Personen falsche Aussagen zuschreibt.
Wo KI-Recherche an ihre Grenzen stößt
Ein konkretes Beispiel: In einem Test mit gängigen Rechtsfragen lieferte ein großes Sprachmodell in etwa 30 Prozent der Fälle Antworten, die zwar juristisch klingen, aber inhaltlich falsch oder veraltet waren. Bei medizinischen Dosierungsangaben, Steuerfristen oder aktuellen Gesetzesständen kann das folgenreich sein. Wer sich auf eine KI-Antwort zur Abgabefrist für die Steuererklärung verlässt, ohne die Angabe gegenzuprüfen, riskiert mehr als nur Verwirrung.
Hinzu kommt das Trainingsdaten-Problem. Die meisten Modelle haben einen Wissensschnitt, der Monate oder Jahre zurückliegt. Ereignisse, Gesetzesänderungen oder neue wissenschaftliche Erkenntnisse nach diesem Datum sind schlicht nicht enthalten. Modelle mit Webzugang können Teile dieses Problems umgehen, aber sie sind selektiv in dem, was sie abrufen, und überprüfen ihre Quellen nicht systematisch.
Was Studien über KI-Empfehlungen sagen
Interessant ist, welche Quellen KI-Systeme bei ihren Antworten bevorzugen. Eine Auswertung aus dem Jahr 2026 hat untersucht, welche Quellen ChatGPT & Co. empfehlen, wenn Nutzer nach Informationen oder Dienstleistungen fragen. Das Ergebnis zeigt deutliche Muster: Bestimmte Domänen tauchen überproportional häufig auf, andere werden systematisch ignoriert, unabhängig von ihrer inhaltlichen Qualität. Das ist für Nutzer relevant, weil es bedeutet, dass die Quellenauswahl der KI keine neutrale Kuratierung darstellt, sondern ein Artefakt des Trainings ist.
Wer also eine KI nach dem besten Ratgeber oder der verlässlichsten Quelle zu einem Thema fragt, bekommt keine objektive Empfehlung. Er bekommt eine Antwort, die von der Textverteilung in den Trainingsdaten abhängt. Gut sichtbare, viel verlinkte und oft zitierte Inhalte werden bevorzugt. Das entspricht nicht zwingend inhaltlicher Qualität.
Spezifische Schwachstellen nach Themenbereich
- Recht und Steuern: Gesetzeslagen ändern sich, KI-Modelle spiegeln häufig veraltete Stände wider. Verbindliche Auskünfte gibt es nur beim zuständigen Amt oder einer Fachkraft.
- Medizin und Gesundheit: Dosierungen, Wechselwirkungen und Therapieempfehlungen erfordern aktuelle Fachdatenbanken und individuelle Beurteilung.
- Statistik und Zahlen: KI-Modelle nennen gerne Prozentzahlen und Studien. Diese sind regelmäßig falsch zugeordnet oder frei erfunden.
- Lokale und aktuelle Ereignisse: Ohne Echtzeit-Webzugang sind Modelle bei aktuellen Themen strukturell blind.
- Wissenschaftliche Zitate: DOIs, Autoren und Erscheinungsjahre werden häufig falsch angegeben oder sind komplett fiktiv.
Woran gute Nutzung von KI-Recherche erkennbar ist
Das alles bedeutet nicht, dass KI-Systeme im Rechercheprozess keinen Platz haben. Es kommt auf den Einsatzzweck an. Als erster Orientierungsschritt, um sich ein Thema zu erschließen, sind sie effizient. Als Ideengeber für Folgefragen funktionieren sie gut. Als Formulierungshilfe oder Zusammenfassung von Material, das man selbst bereits gelesen hat, leisten sie echten Mehrwert.
Die kritische Linie verläuft dort, wo die KI-Antwort die einzige Quelle bleibt. Wer sich bei einer konkreten Entscheidung ausschließlich auf ChatGPT verlässt, handelt so, als würde er eine Diagnose allein aus einem Lexikonartikel ableiten. Das Bundesgesundheitsministerium etwa weist ausdrücklich darauf hin, dass digitale Gesundheitsinformationen immer mit Blick auf ihre Quelle und Aktualität bewertet werden sollten. Dasselbe Prinzip gilt für jede andere Themendomäne.
Qualitätssicherung bleibt Menschenaufgabe
Verlässliche Recherche bedeutet 2026 nicht, keine KI zu nutzen. Es bedeutet, ihre Ausgaben wie einen ersten Entwurf zu behandeln, der geprüft werden muss. Konkret heißt das: Kernaussagen mit Originalquellen abgleichen, Zahlen bei Primärquellen nachschlagen und bei rechtlich oder gesundheitlich relevanten Fragen Fachleute einbeziehen.
Für Zahlen und Statistiken zu Deutschland sind Primärquellen wie Destatis, das Statistische Bundesamt, eine deutlich belastbarere Grundlage als eine KI-Antwort, die dieselbe Zahl möglicherweise aus einem Sekundärartikel mit Fehler übernommen hat. Der Aufwand, solche Quellen direkt zu konsultieren, ist gering. Der Unterschied in der Zuverlässigkeit ist groß.
KI-Systeme sind in der Recherche ein Werkzeug unter vielen, kein Ersatz für kritisches Denken. Wer das versteht, kann sie sinnvoll einsetzen. Wer das vergisst, sitzt früher oder später einer überzeugend klingenden Fehlinformation auf.