KI in der klinischen Entwicklung: neun Andockpunkte entlang der Metadatenkette
KI-Anwendungen in der klinischen Entwicklung hängen an derselben Vorbedingung wie die Automatisierung davor: strukturierte, semantisch verankerte Metadaten. Der Artikel legt neun Andockpunkte auf die Kette von der Studiendefinition bis zur Einreichung und benennt je Stufe den tragenden Standard und den Belegtyp. Die belegten Effekte sitzen an den Rändern, vorne beim Authoring aus Struktur und hinten bei Zusammenfassungen für die Einreichung. Die Mitte, der durchgehende Weg bis zu Analyseergebnissen, ist die offene Strecke. Der begrenzende Faktor ist dabei nicht die Modellqualität: Durchlaufzeiten für Studienberichte haben sich seit 2013 kaum verändert, und fortgeschrittene KI-Adoption bleibt im klinischen Datenmanagement einstellig.
Die Diskussion über KI in der klinischen Entwicklung läuft überwiegend nach Werkzeugen sortiert: ein Tool für das Protokoll, eines für den Studienbericht, eines für die Einreichung. Sortiert man stattdessen nach der Prozesskette, zeigt sich ein anderes Muster. Jede Anwendung hängt an einem Standard, der die Struktur bereitstellt, auf die das Modell zugreift. Fehlt dieser Standard oder ist er im Unternehmen nicht umgesetzt, bleibt die Anwendung ein Inselwerkzeug, unabhängig von der Modellgüte.
Die folgende Landkarte legt neun Andockpunkte auf die Kette von der Studiendefinition bis zur Einreichung. Je Stufe stehen der ermöglichende Standard und die Art des vorliegenden Belegs dabei. Der Belegtyp ist dabei die wichtigere Spalte: Zwischen einer demonstrierten Ableitung in einem CDISC-Projekt, einer Preprint-Studie mit zwei Fällen und einer Roadmap-Aussage liegen Größenordnungen an Verbindlichkeit.
Die Kette im Überblick
| # | Prozessschritt | KI-Andockpunkt | Tragender Standard | Belegtyp |
|---|---|---|---|---|
| 1 | Studiendesign, Protokoll-Authoring | Abschnitte aus strukturierten Metadaten erzeugen, aus Bausteinen assemblieren | ICH M11, USDM v4.0, MDR/SDR | Forschung, Preprint |
| 2 | Semantische Verknüpfung | Wiederverwendung vorschlagen, Inhalte transformieren und verknüpfen | Biomedical Concepts, NCIt, Knowledge Graph | Grundlage vorhanden |
| 3 | Erhebungs-Setup | eCRF-Spezifikationen, ODM.xml und annotierte CRFs ableiten | CDISC 360i, Biomedical Concepts | demonstriert |
| 4 | Tabulation | define.xml, Dataset Specializations, Shell-Datasets ableiten | CDISC 360i, SDTM, Define-XML | demonstriert |
| 5 | Ableitung und Analyse | Analysespezifikationen erzeugen, Analysewege explorieren | ARS v1.0 | Standard vorhanden, Kette offen |
| 6 | Ergebnisse und Berichte | Studienberichte aus strukturierten Analyse-Metadaten erzeugen | ARS, Analyse-Metadaten | Praxisberichte |
| 7 | Einreichung | Zusammenfassungen für IND und eCTD erstellen | strukturierte Quellmetadaten | Studie mit Realdaten |
| 8 | Wiederverwendung im Lebenszyklus | Protokoll in Einwilligungserklärung und Patientenzusammenfassung überführen | MDR/SDR, Sprachmodell | Konzept, erste Werkzeuge |
| 9 | Laufende Prüfungen | Machbarkeit, Kosten und Konsistenz während des Designs prüfen | strukturierte Studienmetadaten | kaum belegt |
Vorne: Authoring aus Struktur
Die Stufen 1 und 2 setzen voraus, dass Protokollinhalt als adressierbares Objekt vorliegt. Diese Voraussetzung ist seit dem 19. November 2025 standardisiert: ICH M11 beschreibt Protokollinhalt in einer Technical Specification als Datenelemente mit definierter Bedeutung, Verbindlichkeit und Kardinalität, das maschinenlesbare Modell dazu liefert CDISC USDM in Version 4.0 vom 3. Juni 2025. Die Einordnung beider Standards steht im Beitrag ICH M11 nach Step 4.
Der Beleg für die generative Seite ist dünner als die Erwartung. Eine Arbeit zur Erzeugung von Protokollabschnitten aus strukturierten Metadaten erreichte mit GPT-3.5-Turbo und einem einzigen Beispiel im Prompt eine Kosinus-Ähnlichkeit von 0,78 und einen BLEU-1-Wert von 0,80 gegenüber Referenztexten. Beides sind Ähnlichkeitsmaße gegenüber einer Vorlage, keine Aussagen über fachliche Korrektheit oder regulatorische Verwendbarkeit. Die Arbeit belegt, dass generatives Authoring aus Struktur im Grundsatz funktioniert. Sie belegt nicht, dass ein so erzeugter Abschnitt ohne fachliche Überarbeitung einreichungsfähig ist.
Stufe 2 ist die stillste und zugleich die tragende. Sobald Messungen über Biomedical Concepts fachlich definiert und in NCIt verankert sind, lässt sich maschinell erkennen, dass zwei Studien dieselbe Beobachtung erheben, auch bei unterschiedlicher Benennung. Genau diese Erkennung ist die Voraussetzung für jeden Wiederverwendungsvorschlag. Die zweischichtige Struktur dahinter beschreibt der Beitrag zu Biomedical Concepts.
Mitte: demonstrierte Ableitung und eine offene Strecke
Die Stufen 3 und 4 sind die einzigen, für die eine durchgeführte Ableitung öffentlich dokumentiert ist. Das Build-Team der CDISC-Initiative 360i, gestartet im März 2025, erzeugte aus der Verknüpfung von Biomedical Concepts mit USDM automatisch eCRF-Spezifikationen, ODM.xml, annotierte CRFs, SDTM Dataset Specializations, Trial-Design-Domänen, define.xml und SDTM-Shell-Datasets. CDISC benennt als erklärtes Ziel der Initiative, KI zu ermöglichen, manuelle Tätigkeiten zu eliminieren und Nachvollziehbarkeit sicherzustellen (eigene Übersetzung).
Wenig davon ist Sprachmodell. Die Ableitung von define.xml aus einer Konzeptbindung ist deterministische Transformation, kein generatives Verfahren. Der KI-Anteil in dieser Zone liegt nicht im Erzeugen, sondern im Vorschlagen und Prüfen: welches Konzept passt, welche Spezialisierung fehlt, welche Bindung ist inkonsistent.
Stufe 5 markiert die Bruchstelle. Der Standard, der Analyseergebnisse maschinenlesbar spezifizierbar macht, existiert seit dem 19. April 2024 mit dem Analysis Results Standard (ARS) in Version 1.0. Die in 360i demonstrierte Kette reicht jedoch bis zur Tabulation, nicht durchgängig bis zu den Analyseergebnissen. Damit fehlt genau das Bindeglied, das nötig wäre, um Analyse und Reporting aus derselben Quelle abzuleiten wie die Erhebung. Effizienzversprechen für die Analysestufe reichen derzeit weiter als die Belege, und der Grund liegt in dieser Lücke, nicht in fehlenden Modellen.
Für Stufe 6 existieren Praxisberichte zur Erstellung von Studienberichten mit generativen Verfahren, überwiegend in Fachmedien und ohne offengelegte Messmethodik. Als Richtungssignal brauchbar, als Grundlage für eine Investitionsentscheidung nicht.
Hinten: Zusammenfassungen für die Einreichung
Der konkreteste Effizienzdatenpunkt der gesamten Kette liegt an Stufe 7. Eine im September 2025 veröffentlichte Arbeit beschreibt ein LLM-gestütztes Werkzeug auf Basis von GPT-4-Turbo für nichtklinische IND-Zusammenfassungen nach eCTD 2.6.2, 2.6.4 und 2.6.6. Für zwei reale IND-Vorgänge, einen mit 18.870 Seiten aus 61 Reports und einen mit 11.425 Seiten aus 58 Reports, sank die Erstellungszeit des Erstentwurfs auf 3,7 beziehungsweise 2,6 Stunden. Gegenüber einem geschätzten Ausgangswert von rund 100 Stunden entspricht das einer Reduktion um etwa 97 Prozent.
Die Zahl ist beeindruckend und braucht drei Einschränkungen. Der Ausgangswert von 100 Stunden ist eine Schätzung, kein gemessener Vorher-Wert. Die Stichprobe umfasst zwei Vorgänge. Und der Vergleich betrifft den Erstentwurf, nicht den freigegebenen Text; der Review-Aufwand nach dem Entwurf ist in der Angabe nicht enthalten.
Warum diese Stufe trotzdem die reifste ist, hat einen strukturellen Grund: Die Quelle ist bereits strukturiert. Nichtklinische Studienberichte liegen vor, sind abgeschlossen und formal geordnet. Die Aufgabe besteht im Zusammenfassen und Umformatieren vorhandener, geprüfter Information, nicht im Erzeugen neuer Aussagen. Genau diese Konstellation, viel geprüfte Struktur als Eingabe, ist die für regulierte Umgebungen günstigste.
Stufe 8 folgt derselben Logik in die andere Richtung: aus dem Protokoll eine Einwilligungserklärung oder eine Patientenzusammenfassung in verständlicher Sprache ableiten. Die Voraussetzung ist dieselbe strukturierte Quelle. Belegt sind hier Konzepte und erste Werkzeuge, keine Effektgrößen. Stufe 9, laufende Machbarkeits- und Konsistenzprüfungen während des Designs, ist bislang überwiegend Zielbild.
Der begrenzende Faktor liegt neben der Technik
Drei unabhängige Datenpunkte zeigen in dieselbe Richtung. TransCelerate nannte am 8. Oktober 2025 die Größenordnung, dass rund 90 Prozent der Protokolle weiterhin als unstrukturierte Dokumente vorliegen. Eine Befragung von 100 Verantwortlichen im klinischen Datenmanagement aus den USA und Europa ergab 2024, dass 75 Prozent AI- oder ML-Verfahren zur Datenqualität einsetzen, fortgeschrittene Adoption in den meisten Funktionen aber unter 10 Prozent bleibt, bei zugleich hohen Technologiebudgets. Und die Durchlaufzeiten für Clinical Study Reports haben sich über ein Jahrzehnt kaum bewegt: von 8 bis 15 Wochen im Jahr 2013 auf 6 bis 15 Wochen.
Jeder dieser Werte hat methodische Schwächen. Die 90-Prozent-Angabe stammt aus einer Pressemitteilung der Initiative selbst, die Befragung aus einem Dienstleisterbericht, die Durchlaufzeiten aus Sekundärquellen. Technologie ist vorhanden und wird beschafft, die Wirkung im Prozess bleibt aus.
Die naheliegende Erklärung ist die Vorbedingung selbst. Ein Werkzeug, das aus strukturierten Metadaten Artefakte ableitet, entfaltet keine Wirkung in einer Organisation, deren Metadaten in Dokumenten stehen. Die Investition landet dann im Werkzeug, während der Engpass eine Ebene tiefer liegt.
Anschluss an die Prüfperspektive
Für Qualitätssicherung und Validierung hat die Kette eine zweite Bedeutung, die unabhängig von Effizienz gilt. Eine Ableitung aus strukturierten Metadaten ist rückverfolgbar: Zu einem generierten Abschnitt lässt sich die Quelle benennen, aus der er stammt, und die Version, in der sie stand. Eine Generierung aus einem Dokumentenkorpus lässt sich das nicht. Struktur ist damit nicht nur die Voraussetzung für den Nutzen, sondern auch für den Nachweis.
Daraus folgt eine Sortierung der Use Cases, die sich mit der Risikologik regulierter Umgebungen deckt. Anwendungen mit geprüfter, strukturierter Eingabe und menschlicher Freigabe der Ausgabe, etwa Stufe 7, verhalten sich anders als Anwendungen, die aus unstrukturiertem Bestand neue Aussagen erzeugen. Die Systematik dazu beschreibt der Beitrag zum Drei-Zonen-Modell für KI-Use-Cases; die Evidenzlage zur Verankerung von Modellausgaben in geprüften Datenbeständen behandelt der Beitrag zu Grounding in regulierten Umgebungen.
Einordnung der eigenen Vorhaben: vier Schritte
- Vorhaben auf der Kette verorten. Jedes laufende oder geplante KI-Vorhaben einer der neun Stufen zuordnen und den tragenden Standard benennen. Vorhaben ohne benennbaren Standard sind der erste Prüffall.
- Strukturgrad der Eingabe bestimmen. Je Vorhaben festhalten, ob die Eingabe strukturierte Metadaten oder Dokumente sind. Das trennt die Fälle mit belastbarem Nutzen von denen mit hohem Nachbearbeitungsaufwand.
- Belegtyp der Anbieteraussagen prüfen. Bei jeder genannten Effektgröße Stichprobe, Ausgangswert und Messgegenstand erfragen. Ein Wert für einen Erstentwurf ist kein Wert für einen freigegebenen Text.
- Reihenfolge korrigieren. Vorhaben an Stufen mit offener Kette, insbesondere Stufe 5, hinter Vorhaben mit demonstrierter Ableitung einordnen, statt die Lücke im Projekt zu schließen.