Die richtigen Fragen
Die vollständigen qrels-Läufe verwenden die Relevanzbewertungen der Datensätze. Verschiedene Suchprofile zeigen, was exakte Begriffe, Bedeutung und Reranking jeweils beitragen.
Retrieval-Benchmarks
Öffentliche Datensätze, vollständige Abfragen und nachvollziehbare Suchprofile. CogLake prüft die Qualität der Ergebnisse zusammen mit Zugriffsrechten und Indexkonsistenz.
Dokumentierter Lauf · 2026-08-20
SciFact: 5.183 Dokumente und 300 Abfragen. LegalQuAD: 200 Dokumente. Alle Profile wurden lokal auf einem Apple M1 Pro mit Docker Desktop ausgeführt. Die Tabelle vergleicht CogLake-Konfigurationen innerhalb dieser Datensätze.
| Datensatz | Suchprofil | nDCG@10 | Recall@10 |
|---|---|---|---|
| BEIR SciFact | Lexical | 0.3820 | 0.4645 |
| BEIR SciFact | Dense | 0.4774 | 0.6129 |
| BEIR SciFact | Hybrid | 0.5034 | 0.6614 |
| BEIR SciFact | Rerank | 0.5360 | 0.6603 |
| MTEB LegalQuAD | Lexical | 0.2045 | 0.2400 |
| MTEB LegalQuAD | Dense | 0.3982 | 0.5500 |
| MTEB LegalQuAD | Hybrid | 0.2968 | 0.5150 |
| MTEB LegalQuAD | Rerank | 0.3538 | 0.5150 |
Die vollständigen qrels-Läufe verwenden die Relevanzbewertungen der Datensätze. Verschiedene Suchprofile zeigen, was exakte Begriffe, Bedeutung und Reranking jeweils beitragen.
In den dokumentierten vollständigen Läufen wurden keine ACL-Leaks oder Indexinkonsistenzen festgestellt. Eine zusätzliche multimodale Testsuite bestand alle 25 Retrieval-Fälle.
Vergleichen Sie mit Ihren Dokumenten, Fragen und Rollen. Ein passendes Suchprofil hängt vom Inhalt und von der Aufgabe ab.
Datensätze und Definitionen: BEIR / SciFact · MTEB LegalQuAD