LitSynthLitSynth
  • Funktionen
  • Preise
  • FAQ
  • Literaturübersicht
  • Blog
  • Methoden

Loading…

LitSynthLitSynth

Transformieren Sie Ihren Forschungsworkflow mit KI-gestützter Literaturanalyse und -synthese

DiscordEmail
Produkt
  • Funktionen
  • Preise
  • FAQ
Ressourcen
  • Blog
  • Methoden
  • Änderungsprotokoll
Partnerlinks
  • Papers finden
  • LitFigure – Wissenschaftliche Abbildungen
Unternehmen
  • Kontakt
Rechtliches
  • Datenschutzrichtlinie
  • Nutzungsbedingungen

Forschungsworkflows

Entdecken Sie fokussierte Leitfäden für Literaturreviews, PubMed-Workflows, Zitationsaudits und PRISMA-lite-Planung.

KI-Generator für LiteraturübersichtenKI-Tool für systematische ÜbersichtPRISMA liteScreening für systematische ÜbersichtDatenextraktion systematische ÜbersichtProtokollgenerator systematische ÜbersichtSemaglutid systematische Übersicht BeispielKI in der Bildung Literaturübersicht BeispielKlimawandel Gesundheit Literaturübersicht Beispiel
©️ 2026 LitSynth. Alle Rechte vorbehalten.
SCORED ONCE · OVERALL FAIL

Screening-Sicherheit und Arbeitslast, gemessen an unberührten Holdouts

Im unberührten 281-Datensatz-Holdout hatte LitSynth null falsche Ausschlüsse und schützte jeden relevanten Datensatz. 82,9 % erforderten dennoch manuelle Prüfung und verfehlten die preregistrierte 80-%-Arbeitslastgrenze. Das Holdout-Ergebnis ist daher ein Fehlschlag.

TOPIC / CD000996

TASK / Intervention

RECORDS / 281

PROTOCOL VERSION / 1

POLICY VERSION / title-abstract-v3

PREREG COMMIT / 8fd1e19

BLIND HASH / 282a24a4830f…

STATUS / FAIL — NO RETEST

Geschützter Recall

100.0%

9/9 relevante Datensätze geschützt · PASS

Falsche Ausschlüsse

0

0.0% der relevanten Datensätze

Manuelle Prüfung

82.9%

233/281 Datensätze · FAIL (Grenze ≤80%)

Auto-Ausschluss

15.7%

44/281 Datensätze zur Ausschlussempfehlung

Gesamtergebnis

FAIL

beide Gates mussten bestehen; kein zusammengesetzter Genauigkeitswert

01 / Vor dem Unblinding gesperrt

Der Fehlschlag gehört zum Ergebnis.

Sicherheit bestanden. Arbeitslast nicht. Das Arbeitslast-Gate scheiterte um 2,9 Prozentpunkte. Nach Sicht der Labels wurde die gesperrte Policy nicht geändert und der Korpus nicht erneut gelaufen.

  1. LOCK 01

    Korpus-Sperre

    CD000996: Inhaled corticosteroids for bronchiectasis. Der gepinnte Quell-Commit, Topic-Hash, PMID-Listen-Hash und die 281 Datensätze sind öffentlich.

  2. LOCK 02

    Policy-Sperre

    title-abstract-v3, deepseek-v4-flash, temperature 0.1, batch size 5. Modell, Temperatur, Batchgröße und Quell-Hashes sind fest.

  3. LOCK 03

    Vorhersagen vor Labels

    Alle 281 labelfreien Entscheidungen müssen geschrieben und gehasht sein, bevor qrels geholt werden dürfen.

  4. LOCK 04

    Sicherheit plus Arbeitslast

    Falsche Ausschlüsse und geschützter Recall stehen neben UNSURE-Zahl und manueller Prüfungsrate. Eine sichere, aber unbrauchbare Prüfwarteschlange besteht nicht.

02 / Vollständige Prüfspur einsehen

Reihenfolge, Zählungen und Fehlschlag nachvollziehen.

Vorhersagen versiegelt (UTC)
2026-09-01T02:31:50.490Z
Labels geholt / unblinded (UTC)
2026-09-01T02:31:50.492Z
Rohe geblindete Vorhersagen · SHA-256
282a24a4830f59e1ce7e1b91c449e7dcc9171464784a3075f0cfea827693f486
Alle bewerteten Vorhersagenpredictions.csvFalsche-Ausschluss-Listefalse-excludes.csvManuelle-Prüf-Listemanual-review.csvKennzahlen und Gatesmetrics.jsonAblauf und Blind-Hashrun.jsonKorpus- und Quell-Hashesmanifest.jsonGeblindete Vorhersagenblinded-predictions.jsonMaschinenlesbare Preregistrierungpreregistration.jsonMenschenlesbare Preregistrierungpreregistration.md

Grenzen

Nur ein unberührter Holdout wurde bewertet: ein CLEF-TAR-Thema, 281 Datensätze, 9 goldrelevante Datensätze, nur Titel und Abstracts. Geschützter Recall zählt relevante Datensätze mit INCLUDE oder UNSURE; das heißt nicht, dass jeder relevante Datensatz korrekt eingeschlossen wurde.

Manuelle Prüfung heißt hier UNSURE / alle Datensätze (233/281). Das ist eine Warteschlangengröße, keine gemessene Gutachterzeit. INCLUDE- und EXCLUDE-Empfehlungen brauchen weiterhin menschliche Kontrolle. Auto-Ausschluss ist die Modellempfehlungsrate, keine Erlaubnis, Datensätze ungeprüft zu verwerfen.

Was das NICHT belegt

  • Garantierter Recall oder Arbeitslastsenkung auf anderen Themen, Korpora, Modellen oder Policy-Versionen.
  • Volltext-Eligibilität, Extraktionsgenauigkeit, Validität der Bias-Bewertung oder anspruchsgenaue zitierte Synthese.
  • Überlegenheit gegenüber Rayyan oder einem anderen Werkzeug: das ist kein Direktvergleich.
  • Ersatz für unabhängiges Doppelscreening oder die endgültigen Einschluss- und Ausschlussentscheidungen der Prüfenden.

Der 277-Datensatz-Korpus ist kein Leistungsanspruch mehr

Seine Labels flossen in die Policy-Revision ein und bleiben nur als transparentes Regressionsarchiv nach der Fehleranalyse. Der unberührte Holdout wurde einmal bewertet. Das gescheiterte Arbeitslast-Gate ist veröffentlicht; der Korpus wird nicht als unberührte Evidenz wiederverwendet.

Historisches Entwicklungsarchiv öffnen