Ein Forschungsteam der Universität Wien um Johannes Kirchmair hat eine statistische Methode entwickelt, mit der sich versteckte Auffälligkeiten in wissenschaftlichen Datensammlungen automatisiert erkennen lassen. Die Methode lässt sich direkt auf große Datenbestände anwenden und ermöglicht es Forschenden, problematische Datensätze gezielt zu identifizieren. Dies hebt die Qualität datengetriebener Forschung erheblich und fördert die Entwicklung verlässlicher KI-Anwendungen.
Moderne Labor- und Analytikverfahren beruhen zunehmend auf der Nutzung umfangreicher Datenbestände. In der Wirkstoffforschung werden beispielsweise oft Millionen experimenteller Messwerte aus Datenbanken zusammengetragen und für die Entwicklung neuer Arzneistoffe in KI-Modelle eingespeist. Die Datenqualität ist dabei kritisch: Fehler bei der Erfassung, Verarbeitung oder Aggregation verzögern nicht nur nachfolgende Analysen, sondern können ganze Forschungsprozesse entwerten. Die systematische Überprüfung großer Datenmengen stellt die Analytik jedoch vor erhebliche Herausforderungen.
Das Benford-Gesetz als analytischer Indikator
Uday Abu-Shehab, Matthias Welsch und Johannes Kirchmair haben daher ein Verfahren zur automatischen Identifikation auffälliger Datensätze entwickelt. Im Mittelpunkt steht das Benford-Gesetz, das die Verteilung der ersten Ziffern in natürlich entstandenen Datensätzen beschreibt. Signifikante Abweichungen von diesem Muster dienen als Indikator für analytische Besonderheiten oder Qualitätsprobleme.
„Unser Verfahren liefert keinen direkten Beweis dafür, dass Daten fehlerhaft oder verfälscht sind“, erklärt Johannes Kirchmair. „Vielmehr hilft es dabei, aus der großen Anzahl an Datensätzen jene herauszufiltern, die einer näheren Überprüfung zugeführt werden sollten. Damit können Forschende ihre Aufmerksamkeit gezielt auf potenziell problematische Datensätze konzentrieren.“
Simulation-Based Benfordness Estimation (SBBE)
Zur Priorisierung der Daten entwickelte das Team den Ansatz „Simulation-Based Benfordness Estimation“ (SBBE). Das Verfahren kombiniert Computersimulationen mit Bayes-Statistik und liefert neben der Qualitätsbewertung auch eine Quantifizierung der damit verbundenen Unsicherheit. Dies ermöglicht eine deutlich präzisere Vergleichbarkeit als bisherige Methoden.
„Bei vielen bestehenden Ansätzen hängt das Ergebnis von Qualitätsanalysen stark von der Anzahl der verfügbaren Datenpunkte ab“, erklärt Uday Abu-Shehab. „Unser Verfahren berücksichtigt diese Unsicherheit ausdrücklich und ermöglicht dadurch faire Vergleiche zwischen Datensätzen unterschiedlicher Größe. Das macht die Ergebnisse deutlich robuster.“
Validierung an Bioaktivitätsdatenbanken
Zur Validierung testeten die Forscher die Methode an biologischen Aktivitätsdaten, welche die Interaktionsstärke zwischen Wirkstoffen und Zielproteinen beschreiben. Die Erhebung zeigte für große Bioaktivitätsdatenbanken insgesamt eine hohe Datenqualität. Einzelne Datensätze mit statistischen Auffälligkeiten konnten durch die Analyse gezielt auf spezifische Besonderheiten im Versuchsdesign, in der Datenverarbeitung oder in der Kuratierung zurückgeführt werden.
Fachübergreifendes Potenzial für Labor und KI
„Gerade für die datengetriebene Forschung werden Werkzeuge zur automatisierten Qualitätskontrolle immer wichtiger“, sagt Matthias Welsch. „Unser Ziel ist es, Forschenden ein einfach anwendbares Instrument zur Verfügung zu stellen, um Auffälligkeiten frühzeitig zu erkennen und die Qualität wissenschaftlicher Datensammlungen weiter zu verbessern.“ Da SBBE unabhängig vom spezifischen Fachgebiet agiert, bietet die Methode breite Anwendungsmöglichkeiten. In allen Bereichen der Labordiagnostik und Analytik, in denen große numerische Datenmengen anfallen, kann das Verfahren verborgene Unregelmäßigkeiten aufdecken und somit als Basis für wissenschaftliche Entscheidungen sowie verlässliche KI-Modelle dienen.
Kernaspekte im Überblick
- Herausforderung: Die systematische Qualitätskontrolle großer Datenmengen in der datengetriebenen Forschung ist zeitintensiv und komplex.
- Lösungsansatz: Forschende der Universität Wien nutzten das Benford-Gesetz zur Entwicklung einer automatisierten Screeningsmethode.
- Methodik: „Simulation-Based Benfordness Estimation“ (SBBE) verknüpft Bayes-Statistik mit Simulationen zur robusteren Identifikation von Fehlerquellen unabhängig von der Stichprobengröße.
- Mehrwert: SBBE steigert die Datenintegrität in der Analytik und schafft verlässliche Datengrundlagen für KI-gestützte Anwendungen.
Quelle
Publikation
Uday Abu-Shehab, Matthias Welsch & Johannes Kirchmair. A Bayesian framework for anomaly detection in drug discovery data based on Benford’s law. In Patterns (2026).
DOI: 10.1016/j.patter.2026.101683