fix: semantic_dedup.py — adicionar using='dense' ao QueryRequest

Collection knowledge_base usa named vectors (dense + sparse). O Qdrant
exige o parâmetro 'using' em collections com múltiplos vetores nomeados.
Sem ele, query_batch_points retornava 'Not existing vector name error'
em 100% das batches (44/44). O script reportava falsos 0 near-duplicates.

Correção: 1 linha — using='dense' em models.QueryRequest (linha 176).

Validado com --dry-run --threshold 0.95 contra 8886 pontos reais:
0 erros, 1776 near-duplicate pairs detectados.
This commit is contained in:
ClaudioDrews 2026-06-03 15:59:28 -03:00
parent 3fd7cd6faf
commit 35f85066a4
1 changed files with 1 additions and 0 deletions

View File

@ -175,6 +175,7 @@ def find_near_duplicates(chunks: List[Dict],
requests_list.append(
models.QueryRequest(
query=vec,
using="dense",
limit=1,
score_threshold=threshold,
filter=models.Filter(