fix(recherche): Suchbegriffe treffen wieder, Verzeichnis ohne Dubletten

Vier Befunde aus dem Vergleich vom 02.08.2026, sortiert nach Wirkung.

1. Mehrwort-Suchbegriffe fielen im RSS-Abgleich durch. Dieselbe Lage lieferte
   je nach Titel 79 oder 17 Treffer. Die Keyword-Erzeugung liefert bei
   politisch formulierten Titeln Phrasen ("migrationskrise spanien",
   "aufnahmeverfahren eu"), das Matching verglich sie als starre Zeichenfolge.
   Die Schlagzeile "Migrationskrise in Spanien" enthaelt "migrationskrise
   spanien" nicht, wegen des Wortes dazwischen. Aus 53 Artikeln wurden so 16.
   Eine Phrase trifft jetzt, wenn alle ihre Bestandteile im Text vorkommen,
   unabhaengig von Reihenfolge und Abstand. Die Genauigkeit bleibt erhalten,
   nur die starre Reihenfolge faellt weg.

   Dazu der Auftrag an die Keyword-Erzeugung: Einzelwoerter statt Phrasen, und
   die harten Eigennamen der Lage sind Pflicht. Bei den betroffenen Laeufen
   fehlte "ceuta" komplett, dafuer stand "europol migration" in der Liste, was
   den Europol-Feed anzog und sieben themenfremde Pressemitteilungen
   einbrachte, die der Topic-Filter danach wieder aussortieren musste.

2. Dubletten im Quellenverzeichnis. Lage 56 fuehrte 30 Eintraege fuer 28
   Adressen, zweimal dieselbe tagesschau-Meldung unter je zwei Nummern.
   Ausgerechnet die strittigste Behauptung, der offene Brief der 22 Staaten,
   stuetzte sich damit auf "3 Quellen", von denen zwei derselbe Artikel waren.
   Gleiche Adresse heisst jetzt ein Eintrag, Verweise auf die entfernte Nummer
   werden auf den behaltenen umgebogen. Verglichen wird ohne Schema, www und
   Endschraegstrich.

3. Die Zeitleiste wird deterministisch sortiert. Im selben Bericht sprang der
   letzte Eintrag von 12:44 zurueck auf 17:47. Der Auftrag verlangt die
   Sortierung zwar vom Modell, im prominentesten Kapitel darf sie aber nicht
   von dessen Sorgfalt abhaengen. Gegenprobe an Lage 56: 23:23, 22:09, 17:47,
   16:58 statt des Sprungs ans Ende.

4. Weiterleitungen zaehlen als ein Beleg. Sie verbergen ihr Zielmedium, also
   laesst sich nicht behaupten, dass dahinter verschiedene Redaktionen stehen.
   Die bisherige Einzelzaehlung stellte den Anthropic-Weg rechnerisch besser:
   in Lage 57 standen 10 ausgewiesene Belege fuer 7 Haeuser, weil vier der elf
   Adressen news.google.com-Weiterleitungen waren.

Gegenprobe an beiden gespeicherten Laeufen: Lage 56 zeigt 28 statt 30
Verzeichniseintraege, beide Berichte zaehlen lueckenlos, die Zeitleiste ist
sortiert.

Neu sind 26 Pruefungen, insgesamt laufen 206 ohne Netzzugriff und ohne Kosten.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Dieser Commit ist enthalten in:
claude-dev
2026-08-02 00:43:28 +02:00
Ursprung de3cb7223f
Commit 9868a9748a
8 geänderte Dateien mit 272 neuen und 11 gelöschten Zeilen

Datei anzeigen

@@ -165,6 +165,7 @@ tests/:
test_qc_und_runden.py: "Absicherung der Duplikatpruefung und Abbruch der Suchrunden bei erreichter Treffergrenze"
test_mehrfachantwort.py: "Antworten, in denen sich das Modell selbst korrigiert und mehrere Fassungen liefert, die ausfuehrlichste muss gewinnen"
test_faktencheck_belegtiefe.py: "Belegzaehlung nach Medienhaus, Nachbedingung fuer bestaetigte Fakten, Sperre gegen das Hochstufen von developing, getrennte Bezeichnungen fuer Widerspruch und Widerlegung"
test_rss_treffer.py: "Keyword-Matching der RSS-Auswertung: Mehrwort-Begriffe treffen wortweise, Auftrag verlangt Einzelbegriffe und Eigennamen"
test_bedrock_wiederholung.py: "Wiederholung des EU-Wegs bei Kapazitaets- und Kontingentfehlern, Staffelung, Zeit- und Wartebudget, Sichtbarkeit im Refresh-Protokoll"
test_quellenausgabe.py: "Ausgabetreue des Quellenverzeichnisses: Nummern aus dem Lagebild statt Zeilennummern, keine Kappung, ein Verlag ein Name, Statistik deckungsgleich mit dem Verzeichnis"
```