Der Vergleichslauf zur Innenministerkonferenz (Lage 49) zeigte, dass der
verbesserte Faktencheck zwar zehn Fakten lieferte, davon aber nur drei
uebrig blieben. Die Ursachen lagen in drei nachgelagerten Stellen.
1. Quellenzuordnung stufte alle zehn Fakten herab.
Durch den groesseren Belegblock stuetzt das Modell seine Fakten jetzt
staerker auf die europaeische Suche als auf die gespeicherten Meldungen.
Es zitiert dabei die Belegnummern statt vollstaendiger Adressen. Die
Quellenzuordnung suchte daraufhin vergeblich nach passenden Meldungen und
stufte jeden Fakt herab. Im Vergleich: Lauf 45 hatte null Herabstufungen,
Lauf 44 eine, Lauf 49 zehn von zehn.
Behoben an zwei Stellen. Die Belegsuche gibt die gefundenen Quellen jetzt
einzeln zurueck, der Faktencheck reicht sie an die Zuordnung durch, und
der Auftrag verlangt ausdruecklich die vollstaendige Adresse je Beleg.
2. Duplikatpruefung loeschte sieben von zehn Fakten.
Das Clustering warf inhaltlich verschiedene Beschluesse in eine Gruppe,
weil viele Behauptungen gleich beginnen. Es gab keinerlei Absicherung, bei
kleinen Faktenmengen entschied das Modell sogar voellig allein.
Zwei Sicherungen greifen jetzt. Eine Gruppe, die mehr als 40 Prozent aller
Fakten umfasst, wird verworfen. Und jeder Loeschkandidat muss dem
behaltenen Fakt auch rechnerisch aehnlich sein, Grenze 0,55 im selben Mass
wie im Vorfilter. Beide Werte sind ueber Umgebungsvariablen einstellbar.
3. Leerrunden in der Recherche.
War die Treffer-Obergrenze erreicht, brach nur die innere Schleife ab. Die
Rundenschleife lief bis zum Ende weiter und befragte jedes Mal das teuerste
Modell, ohne noch eine einzige Suche auszufuehren. Das kostete rund 0,17
USD je Durchgang, bei drei Durchgaengen etwa 0,50 USD pro Aktualisierung.
Der Weg ueber die Anthropic-CLI bleibt unveraendert. Neu sind 16 Pruefungen,
darunter der nachgebildete Fall aus Lage 49, insgesamt laufen jetzt 80
Pruefungen ohne Netzzugriff und ohne Kosten.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Der Faktencheck ueber Bedrock und staan lieferte spuerbar weniger belegte
Fakten als der bisherige Weg ueber die Anthropic-CLI. Ursache war die Bauart.
Der bisherige Weg sucht waehrend der Pruefung selbst und kann bei duenner
Beleglage nachfassen, die EU-Fassung bekam dagegen einen festen, vorab
beschafften Stapel Belege und hatte genau einen Versuch.
Drei Aenderungen schliessen die Luecke.
1. Mehr Belege je Pruefung. Statt 3 Anfragen mit je 3 Treffern laufen jetzt
7 Anfragen mit je 6 Treffern, und bis zu 14 statt 8 Pruefpunkte gehen in
die Planung ein. Gleiche Quellen werden nur einmal in den Kontext gelegt.
2. Punktbezogene Planung. Das planende Modell ordnet jeder Suchanfrage zu,
welche Behauptung sie belegen soll, statt allgemein zum Thema zu suchen.
3. Echte Nachhak-Runde. Bleiben nach der Pruefung mindestens zwei
Behauptungen unbelegt, wird fuer genau diese noch einmal gesucht, mit
anderen Anfragen als zuvor, und nur diese Punkte werden neu bewertet.
Ein Status wird dabei nur angehoben, nie gesenkt, und faellt die Runde
aus, bleiben die Fakten unveraendert.
Die Nachhak-Runde greift in allen drei Pruefwegen, also bei der Erstpruefung,
der inkrementellen Pruefung und der Pruefung in Themengruppen. Gruppen nutzen
kleinere Suchmengen, da sie parallel laufen und je nur ein Teilthema abdecken.
Alle Mengen sind ueber Umgebungsvariablen einstellbar.
Der Weg ueber die Anthropic-CLI bleibt unveraendert, das sichern sechs
Regressionstests ab. Neu sind zwei Testdateien mit zusammen 55 Pruefungen,
die ohne Netzzugriff und ohne Kosten laufen.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>