fix(detection): пофрагментная локализация уровня 1 + полное хранение отпечатков

Две связанные проблемы, ломавшие качество детекции:

1. Уровень 1 (Winnowing) репортил весь документ одним совпадением на позиции
   0..длина — в отчёте нельзя было понять, ГДЕ плагиат. Теперь winnow'им
   каждый фрагмент и находим источник + позицию для каждого, так отчёт
   показывает "символы A-B скопированы из источника X".

2. MAX_FINGERPRINTS_PER_DOC=500 обрезал отпечатки статьи (у типичной статьи
   их ~3600), причём произвольную выборку. Из-за этого скопированный фрагмент
   почти не разделял отпечатки с источником (проверено: хранилось ~14%,
   фрагмент находил 17% своих хэшей → не срабатывало). Winnowing рассчитан на
   ПОЛНОЕ хранение; поднял лимит до 20000.

Также overall_similarity считается по числу уникальных помеченных позиций,
а не совпадений — фрагмент, совпавший с несколькими источниками, больше не
раздувает процент выше 100.

Проверено end-to-end: документ с дословной вставкой из статьи корпуса →
вставка локализована (chars 1027-2385 = 100%, источник атрибутирован);
чисто оригинальный текст → 0% (нет ложных срабатываний).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
jze9
2026-07-23 19:57:05 +05:00
parent ef2723e1d3
commit 25e55a3f7d
3 changed files with 58 additions and 32 deletions

View File

@@ -139,50 +139,64 @@ def extract_and_check(
)
logger.info(f"Фрагментов создано: {len(fragments)}")
# ──── Уровень 1: Winnowing fingerprints ────────────────────────────────
# ──── Уровень 1: Winnowing fingerprints (пофрагментно, с локализацией) ───
# Winnow'им КАЖДЫЙ фрагмент отдельно и ищем, с каким источником и на
# какой позиции он совпадает. Так в отчёте видно не «документ похож на X»,
# а «фрагмент на символах AB скопирован из источника X».
level1_matches: list[dict] = []
doc_fingerprint = winnow(text)
from app.models import Document, Fingerprint
if doc_fingerprint:
from app.models import Document, Fingerprint
with db_session() as session:
doc_cache: dict[int, Document] = {}
with db_session() as session:
hashes = list(doc_fingerprint)[: settings.MAX_FINGERPRINTS_PER_DOC]
for frag in fragments:
frag_fp = winnow(frag["text"])
if not frag_fp:
continue
frag_hashes = list(frag_fp)
# Найти совпадения в базе fingerprints
matching_docs = session.execute(
# Источник, разделяющий больше всего отпечатков с этим фрагментом
row = session.execute(
select(
Fingerprint.doc_id,
func.count(Fingerprint.id).label("match_count"),
func.count(Fingerprint.id).label("cnt"),
)
.where(Fingerprint.hash_value.in_(hashes))
.where(Fingerprint.hash_value.in_(frag_hashes))
.group_by(Fingerprint.doc_id)
.having(func.count(Fingerprint.id) > len(hashes) * 0.1)
.order_by(func.count(Fingerprint.id).desc())
.limit(20)
).all()
.limit(1)
).first()
for doc_id, match_count in matching_docs:
similarity = match_count / len(hashes) * 100
if similarity < 20:
continue
if row is None:
continue
doc_id, cnt = row
# Доля отпечатков фрагмента, найденных в источнике
similarity = cnt / len(frag_hashes) * 100
if similarity < settings.EXACT_FRAGMENT_THRESHOLD:
continue
doc = doc_cache.get(doc_id)
if doc is None:
doc = session.get(Document, doc_id)
if not doc:
if doc is None:
continue
doc_cache[doc_id] = doc
level1_matches.append({
"fragment": text[:200],
"position_start": 0,
"position_end": len(text),
"similarity": round(similarity, 1),
"method": "exact",
"source_title": doc.title,
"source_url": doc.url,
"source_db": doc.source,
})
level1_matches.append({
"fragment": frag["text"][:300],
"position_start": frag["start"],
"position_end": frag["end"],
"similarity": round(min(similarity, 100.0), 1),
"method": "exact",
"source_title": doc.title,
"source_url": doc.url,
"source_db": doc.source,
})
logger.info(f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений")
logger.info(
f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений-фрагментов"
)
# ──── Уровень 2: MinHash LSH ────────────────────────────────────────────
level2_matches: list[dict] = []