rag.indexing.deduplication
Chunk deduplication for cleaner vector indices.
Chunk deduplication for cleaner vector indices.
- class ChunkDeduplicator(mode='exact', similarity_threshold=0.95)[source]
Bases:
objectDetect and filter duplicate/near-duplicate chunks.
Supports multiple deduplication modes: - exact: Hash-based exact content matching - similarity: Embedding cosine similarity threshold
- Parameters:
Example
>>> dedup = ChunkDeduplicator(mode="exact") >>> chunks, embeddings = dedup.filter_duplicates(chunks, embeddings)
- is_duplicate(content, embedding=None)[source]
Check if chunk is a duplicate of previously seen content.
Classes
- class ChunkDeduplicator(mode='exact', similarity_threshold=0.95)[source]
Bases:
objectDetect and filter duplicate/near-duplicate chunks.
Supports multiple deduplication modes: - exact: Hash-based exact content matching - similarity: Embedding cosine similarity threshold
- Parameters:
Example
>>> dedup = ChunkDeduplicator(mode="exact") >>> chunks, embeddings = dedup.filter_duplicates(chunks, embeddings)
- is_duplicate(content, embedding=None)[source]
Check if chunk is a duplicate of previously seen content.