fix(detection): пофрагментная локализация уровня 1 + полное хранение отпечатков

Две связанные проблемы, ломавшие качество детекции:

1. Уровень 1 (Winnowing) репортил весь документ одним совпадением на позиции
   0..длина — в отчёте нельзя было понять, ГДЕ плагиат. Теперь winnow'им
   каждый фрагмент и находим источник + позицию для каждого, так отчёт
   показывает "символы A-B скопированы из источника X".

2. MAX_FINGERPRINTS_PER_DOC=500 обрезал отпечатки статьи (у типичной статьи
   их ~3600), причём произвольную выборку. Из-за этого скопированный фрагмент
   почти не разделял отпечатки с источником (проверено: хранилось ~14%,
   фрагмент находил 17% своих хэшей → не срабатывало). Winnowing рассчитан на
   ПОЛНОЕ хранение; поднял лимит до 20000.

Также overall_similarity считается по числу уникальных помеченных позиций,
а не совпадений — фрагмент, совпавший с несколькими источниками, больше не
раздувает процент выше 100.

Проверено end-to-end: документ с дословной вставкой из статьи корпуса →
вставка локализована (chars 1027-2385 = 100%, источник атрибутирован);
чисто оригинальный текст → 0% (нет ложных срабатываний).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
jze9
2026-07-23 19:57:05 +05:00
parent ef2723e1d3
commit 25e55a3f7d
3 changed files with 58 additions and 32 deletions

View File

@@ -152,10 +152,14 @@ def check_plagiarism(
seen_sources.add(key) seen_sources.add(key)
unique_matches.append(m) unique_matches.append(m)
# Вычислить общий процент схожести # Вычислить общий процент схожести по ДОЛЕ помеченных фрагментов документа.
# Считаем уникальные позиции (фрагмент, совпавший с несколькими источниками,
# не должен раздувать процент выше 100).
total_frags = len(fragments) total_frags = len(fragments)
flagged_frags = len(unique_matches) flagged_positions = {m.get("position_start") for m in unique_matches}
flagged_frags = len(flagged_positions)
overall_similarity = (flagged_frags / total_frags * 100) if total_frags > 0 else 0.0 overall_similarity = (flagged_frags / total_frags * 100) if total_frags > 0 else 0.0
overall_similarity = min(overall_similarity, 100.0)
result = { result = {
"overall_similarity": round(overall_similarity, 2), "overall_similarity": round(overall_similarity, 2),

View File

@@ -39,7 +39,15 @@ class Settings(BaseSettings):
# Настройки обработки текста # Настройки обработки текста
FRAGMENT_WINDOW_WORDS: int = 200 # Размер окна для фрагментов FRAGMENT_WINDOW_WORDS: int = 200 # Размер окна для фрагментов
FRAGMENT_OVERLAP_WORDS: int = 50 # Перекрытие фрагментов FRAGMENT_OVERLAP_WORDS: int = 50 # Перекрытие фрагментов
MAX_FINGERPRINTS_PER_DOC: int = 500 # Максимум хэшей Winnowing на документ # Максимум хэшей Winnowing на документ. Winnowing рассчитан на ПОЛНОЕ
# хранение отпечатков: обрезка теряет гарантию, что скопированный фрагмент
# разделит отпечатки с источником (при 500 хранилось ~14% отпечатков статьи,
# и локализованный поиск фрагментов почти не срабатывал). Держим высоким;
# цена — размер таблицы fingerprints (~3-4К строк на статью).
MAX_FINGERPRINTS_PER_DOC: int = 20000
# Порог уровня 1: % отпечатков фрагмента, найденных в источнике, чтобы
# пометить фрагмент как скопированный
EXACT_FRAGMENT_THRESHOLD: float = 40.0
# Скачивание полного текста статей (PDF по URL источника) # Скачивание полного текста статей (PDF по URL источника)
FETCH_FULL_TEXT: bool = False # Включить обогащение полным текстом при заливке корпуса FETCH_FULL_TEXT: bool = False # Включить обогащение полным текстом при заливке корпуса

View File

@@ -139,50 +139,64 @@ def extract_and_check(
) )
logger.info(f"Фрагментов создано: {len(fragments)}") logger.info(f"Фрагментов создано: {len(fragments)}")
# ──── Уровень 1: Winnowing fingerprints ──────────────────────────────── # ──── Уровень 1: Winnowing fingerprints (пофрагментно, с локализацией) ───
# Winnow'им КАЖДЫЙ фрагмент отдельно и ищем, с каким источником и на
# какой позиции он совпадает. Так в отчёте видно не «документ похож на X»,
# а «фрагмент на символах AB скопирован из источника X».
level1_matches: list[dict] = [] level1_matches: list[dict] = []
doc_fingerprint = winnow(text)
if doc_fingerprint:
from app.models import Document, Fingerprint from app.models import Document, Fingerprint
with db_session() as session: with db_session() as session:
hashes = list(doc_fingerprint)[: settings.MAX_FINGERPRINTS_PER_DOC] doc_cache: dict[int, Document] = {}
# Найти совпадения в базе fingerprints for frag in fragments:
matching_docs = session.execute( frag_fp = winnow(frag["text"])
if not frag_fp:
continue
frag_hashes = list(frag_fp)
# Источник, разделяющий больше всего отпечатков с этим фрагментом
row = session.execute(
select( select(
Fingerprint.doc_id, Fingerprint.doc_id,
func.count(Fingerprint.id).label("match_count"), func.count(Fingerprint.id).label("cnt"),
) )
.where(Fingerprint.hash_value.in_(hashes)) .where(Fingerprint.hash_value.in_(frag_hashes))
.group_by(Fingerprint.doc_id) .group_by(Fingerprint.doc_id)
.having(func.count(Fingerprint.id) > len(hashes) * 0.1)
.order_by(func.count(Fingerprint.id).desc()) .order_by(func.count(Fingerprint.id).desc())
.limit(20) .limit(1)
).all() ).first()
for doc_id, match_count in matching_docs: if row is None:
similarity = match_count / len(hashes) * 100
if similarity < 20:
continue continue
doc_id, cnt = row
# Доля отпечатков фрагмента, найденных в источнике
similarity = cnt / len(frag_hashes) * 100
if similarity < settings.EXACT_FRAGMENT_THRESHOLD:
continue
doc = doc_cache.get(doc_id)
if doc is None:
doc = session.get(Document, doc_id) doc = session.get(Document, doc_id)
if not doc: if doc is None:
continue continue
doc_cache[doc_id] = doc
level1_matches.append({ level1_matches.append({
"fragment": text[:200], "fragment": frag["text"][:300],
"position_start": 0, "position_start": frag["start"],
"position_end": len(text), "position_end": frag["end"],
"similarity": round(similarity, 1), "similarity": round(min(similarity, 100.0), 1),
"method": "exact", "method": "exact",
"source_title": doc.title, "source_title": doc.title,
"source_url": doc.url, "source_url": doc.url,
"source_db": doc.source, "source_db": doc.source,
}) })
logger.info(f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений") logger.info(
f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений-фрагментов"
)
# ──── Уровень 2: MinHash LSH ──────────────────────────────────────────── # ──── Уровень 2: MinHash LSH ────────────────────────────────────────────
level2_matches: list[dict] = [] level2_matches: list[dict] = []