Einblicke - KI-Modelle stimmen häufiger überein als Toxikologie-Experten

Eine Studie auf der Eurotox 2026 zeigt: KI-Modelle stimmen konsistenter überein als menschliche Toxikologen. Was das für Ihre IUCLID-Altdaten bedeutet.

· Svetlana Galakhova · 3 Min. Lesezeit
KI-Modelle stimmen häufiger überein als Toxikologie-Experten

Die Toxikologie folgt einigen der strengsten Laborstandards der Wissenschaft: OECD-Leitlinien, GLP-Protokolle, validierte Assays. Eine auf der Eurotox 2026 vorgestellte Studie zeigt: Nicht die Laborarbeit ist der inkonsistente Teil. Es ist die Auswertung.

Der Fall

Im Rahmen der HESI-CITE-Lecture stand das Team von Jess Ewald (EMBL-EBI) vor einem vertrauten Problem: über 100.000 unstrukturierte toxikologische Befunde, gesammelt über Jahrzehnte aus Tierstudien verschiedener Labore, in unterschiedlichen Formaten und nach unterschiedlichen Konventionen. All das musste auf eine standardisierte Ontologie (die Mammalian Phenotype Ontology) abgebildet werden, bevor es sich in großem Maßstab weiterverwenden ließ.

Eine manuelle Zuordnung in diesem Umfang ist nicht realistisch. Das Team baute daher eine LLM-gestützte Pipeline und testete sie gegen sieben erfahrene Toxikolog:innen, die dieselbe Zuordnung von Hand vornahmen.

Das Ergebnis

Gemessen an der mittleren paarweisen Übereinstimmung (Jaccard-Ähnlichkeit):

VergleichÜbereinstimmung
LLM ↔ LLM0,85
Mensch ↔ LLM0,60
Mensch ↔ Mensch0,55

Jeder Unterschied war signifikant bei p < 0,001. Jedes einzelne Modell lag näher an der durchschnittlichen menschlichen Antwort als jede einzelne Expertin oder jeder einzelne Experte an den eigenen Kolleg:innen.

Die unzuverlässigen Leser:innen waren nicht die Modelle. Es waren die Expert:innen.

Warum das über einen Konferenzvortrag hinaus relevant ist

Wir stecken viel Energie in die Frage, ob KI zuverlässig genug für regulatorische Arbeit ist. Dieses Ergebnis stellt die schwierigere Frage in die andere Richtung: Wie zuverlässig ist eigentlich die Experteneinschätzung, auf der bestehende Dossiers bereits aufgebaut sind?

Diese Frage ist für niemanden abstrakt, der eine gewachsene IUCLID-Instanz verwaltet. Jedes über Jahre gepflegte Dossier enthält dieselbe Art von Material: Endpunkt-Zusammenfassungen und Einstufungsbegründungen, verfasst von unterschiedlichen Prüfer:innen, in unterschiedlichen Jahren, in leicht unterschiedlichen Formulierungen. Nichts davon ist technisch falsch. Nur wenig davon stimmt exakt mit dem benachbarten Eintrag überein.

Niemand markiert das als Fehler, denn ein Fehler ist es nicht — es ist Drift. Und diese Drift bleibt unsichtbar, bis jemand zwei Dateien nebeneinander lesen und entscheiden muss, welche Version tatsächlich korrekt ist. Bei einer Migration, einem Audit oder einer Einreichungsprüfung hat diese Entscheidung reale Konsequenzen.

Was das für eine Migration bedeutet

Genau diese Lücke soll eine strukturierte, gut gepflegte Infrastruktur schließen. Ein einziges autoritatives Dossier pro Stoff, aktuelle Auswahllisten und ein Datensatz, der nach außen fließt statt bei jedem Schritt neu abgetippt zu werden, verringert die Zahl der Stellen, an denen sich Drift überhaupt verstecken kann. Das ersetzt keine Experteneinschätzung — es gibt ihr aber eine konsistente Datengrundlage.

Wenn Sie wissen möchten, wie viel Inkonsistenz in Ihren eigenen Altdossiers steckt: Genau das prüfen wir vor einer Migration zu 4chems.com. Sprechen Sie mit uns darüber, was eine strukturierte, aktuelle IUCLID-Umgebung in Ihren Daten sichtbar machen würde.

Quelle: Jess Ewald, HESI-CITE-Lecture, „Connecting chemical effects across biological scales with AI“, Eurotox 2026, Wien.

verwandte Themen