fix(detection): пофрагментная локализация уровня 1 + полное хранение отпечатков
Две связанные проблемы, ломавшие качество детекции: 1. Уровень 1 (Winnowing) репортил весь документ одним совпадением на позиции 0..длина — в отчёте нельзя было понять, ГДЕ плагиат. Теперь winnow'им каждый фрагмент и находим источник + позицию для каждого, так отчёт показывает "символы A-B скопированы из источника X". 2. MAX_FINGERPRINTS_PER_DOC=500 обрезал отпечатки статьи (у типичной статьи их ~3600), причём произвольную выборку. Из-за этого скопированный фрагмент почти не разделял отпечатки с источником (проверено: хранилось ~14%, фрагмент находил 17% своих хэшей → не срабатывало). Winnowing рассчитан на ПОЛНОЕ хранение; поднял лимит до 20000. Также overall_similarity считается по числу уникальных помеченных позиций, а не совпадений — фрагмент, совпавший с несколькими источниками, больше не раздувает процент выше 100. Проверено end-to-end: документ с дословной вставкой из статьи корпуса → вставка локализована (chars 1027-2385 = 100%, источник атрибутирован); чисто оригинальный текст → 0% (нет ложных срабатываний). Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -139,50 +139,64 @@ def extract_and_check(
|
||||
)
|
||||
logger.info(f"Фрагментов создано: {len(fragments)}")
|
||||
|
||||
# ──── Уровень 1: Winnowing fingerprints ────────────────────────────────
|
||||
# ──── Уровень 1: Winnowing fingerprints (пофрагментно, с локализацией) ───
|
||||
# Winnow'им КАЖДЫЙ фрагмент отдельно и ищем, с каким источником и на
|
||||
# какой позиции он совпадает. Так в отчёте видно не «документ похож на X»,
|
||||
# а «фрагмент на символах A–B скопирован из источника X».
|
||||
level1_matches: list[dict] = []
|
||||
doc_fingerprint = winnow(text)
|
||||
from app.models import Document, Fingerprint
|
||||
|
||||
if doc_fingerprint:
|
||||
from app.models import Document, Fingerprint
|
||||
with db_session() as session:
|
||||
doc_cache: dict[int, Document] = {}
|
||||
|
||||
with db_session() as session:
|
||||
hashes = list(doc_fingerprint)[: settings.MAX_FINGERPRINTS_PER_DOC]
|
||||
for frag in fragments:
|
||||
frag_fp = winnow(frag["text"])
|
||||
if not frag_fp:
|
||||
continue
|
||||
frag_hashes = list(frag_fp)
|
||||
|
||||
# Найти совпадения в базе fingerprints
|
||||
matching_docs = session.execute(
|
||||
# Источник, разделяющий больше всего отпечатков с этим фрагментом
|
||||
row = session.execute(
|
||||
select(
|
||||
Fingerprint.doc_id,
|
||||
func.count(Fingerprint.id).label("match_count"),
|
||||
func.count(Fingerprint.id).label("cnt"),
|
||||
)
|
||||
.where(Fingerprint.hash_value.in_(hashes))
|
||||
.where(Fingerprint.hash_value.in_(frag_hashes))
|
||||
.group_by(Fingerprint.doc_id)
|
||||
.having(func.count(Fingerprint.id) > len(hashes) * 0.1)
|
||||
.order_by(func.count(Fingerprint.id).desc())
|
||||
.limit(20)
|
||||
).all()
|
||||
.limit(1)
|
||||
).first()
|
||||
|
||||
for doc_id, match_count in matching_docs:
|
||||
similarity = match_count / len(hashes) * 100
|
||||
if similarity < 20:
|
||||
continue
|
||||
if row is None:
|
||||
continue
|
||||
|
||||
doc_id, cnt = row
|
||||
# Доля отпечатков фрагмента, найденных в источнике
|
||||
similarity = cnt / len(frag_hashes) * 100
|
||||
if similarity < settings.EXACT_FRAGMENT_THRESHOLD:
|
||||
continue
|
||||
|
||||
doc = doc_cache.get(doc_id)
|
||||
if doc is None:
|
||||
doc = session.get(Document, doc_id)
|
||||
if not doc:
|
||||
if doc is None:
|
||||
continue
|
||||
doc_cache[doc_id] = doc
|
||||
|
||||
level1_matches.append({
|
||||
"fragment": text[:200],
|
||||
"position_start": 0,
|
||||
"position_end": len(text),
|
||||
"similarity": round(similarity, 1),
|
||||
"method": "exact",
|
||||
"source_title": doc.title,
|
||||
"source_url": doc.url,
|
||||
"source_db": doc.source,
|
||||
})
|
||||
level1_matches.append({
|
||||
"fragment": frag["text"][:300],
|
||||
"position_start": frag["start"],
|
||||
"position_end": frag["end"],
|
||||
"similarity": round(min(similarity, 100.0), 1),
|
||||
"method": "exact",
|
||||
"source_title": doc.title,
|
||||
"source_url": doc.url,
|
||||
"source_db": doc.source,
|
||||
})
|
||||
|
||||
logger.info(f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений")
|
||||
logger.info(
|
||||
f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений-фрагментов"
|
||||
)
|
||||
|
||||
# ──── Уровень 2: MinHash LSH ────────────────────────────────────────────
|
||||
level2_matches: list[dict] = []
|
||||
|
||||
Reference in New Issue
Block a user