fix(detection): пофрагментная локализация уровня 1 + полное хранение отпечатков
Две связанные проблемы, ломавшие качество детекции: 1. Уровень 1 (Winnowing) репортил весь документ одним совпадением на позиции 0..длина — в отчёте нельзя было понять, ГДЕ плагиат. Теперь winnow'им каждый фрагмент и находим источник + позицию для каждого, так отчёт показывает "символы A-B скопированы из источника X". 2. MAX_FINGERPRINTS_PER_DOC=500 обрезал отпечатки статьи (у типичной статьи их ~3600), причём произвольную выборку. Из-за этого скопированный фрагмент почти не разделял отпечатки с источником (проверено: хранилось ~14%, фрагмент находил 17% своих хэшей → не срабатывало). Winnowing рассчитан на ПОЛНОЕ хранение; поднял лимит до 20000. Также overall_similarity считается по числу уникальных помеченных позиций, а не совпадений — фрагмент, совпавший с несколькими источниками, больше не раздувает процент выше 100. Проверено end-to-end: документ с дословной вставкой из статьи корпуса → вставка локализована (chars 1027-2385 = 100%, источник атрибутирован); чисто оригинальный текст → 0% (нет ложных срабатываний). Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -152,10 +152,14 @@ def check_plagiarism(
|
|||||||
seen_sources.add(key)
|
seen_sources.add(key)
|
||||||
unique_matches.append(m)
|
unique_matches.append(m)
|
||||||
|
|
||||||
# Вычислить общий процент схожести
|
# Вычислить общий процент схожести по ДОЛЕ помеченных фрагментов документа.
|
||||||
|
# Считаем уникальные позиции (фрагмент, совпавший с несколькими источниками,
|
||||||
|
# не должен раздувать процент выше 100).
|
||||||
total_frags = len(fragments)
|
total_frags = len(fragments)
|
||||||
flagged_frags = len(unique_matches)
|
flagged_positions = {m.get("position_start") for m in unique_matches}
|
||||||
|
flagged_frags = len(flagged_positions)
|
||||||
overall_similarity = (flagged_frags / total_frags * 100) if total_frags > 0 else 0.0
|
overall_similarity = (flagged_frags / total_frags * 100) if total_frags > 0 else 0.0
|
||||||
|
overall_similarity = min(overall_similarity, 100.0)
|
||||||
|
|
||||||
result = {
|
result = {
|
||||||
"overall_similarity": round(overall_similarity, 2),
|
"overall_similarity": round(overall_similarity, 2),
|
||||||
|
|||||||
@@ -39,7 +39,15 @@ class Settings(BaseSettings):
|
|||||||
# Настройки обработки текста
|
# Настройки обработки текста
|
||||||
FRAGMENT_WINDOW_WORDS: int = 200 # Размер окна для фрагментов
|
FRAGMENT_WINDOW_WORDS: int = 200 # Размер окна для фрагментов
|
||||||
FRAGMENT_OVERLAP_WORDS: int = 50 # Перекрытие фрагментов
|
FRAGMENT_OVERLAP_WORDS: int = 50 # Перекрытие фрагментов
|
||||||
MAX_FINGERPRINTS_PER_DOC: int = 500 # Максимум хэшей Winnowing на документ
|
# Максимум хэшей Winnowing на документ. Winnowing рассчитан на ПОЛНОЕ
|
||||||
|
# хранение отпечатков: обрезка теряет гарантию, что скопированный фрагмент
|
||||||
|
# разделит отпечатки с источником (при 500 хранилось ~14% отпечатков статьи,
|
||||||
|
# и локализованный поиск фрагментов почти не срабатывал). Держим высоким;
|
||||||
|
# цена — размер таблицы fingerprints (~3-4К строк на статью).
|
||||||
|
MAX_FINGERPRINTS_PER_DOC: int = 20000
|
||||||
|
# Порог уровня 1: % отпечатков фрагмента, найденных в источнике, чтобы
|
||||||
|
# пометить фрагмент как скопированный
|
||||||
|
EXACT_FRAGMENT_THRESHOLD: float = 40.0
|
||||||
|
|
||||||
# Скачивание полного текста статей (PDF по URL источника)
|
# Скачивание полного текста статей (PDF по URL источника)
|
||||||
FETCH_FULL_TEXT: bool = False # Включить обогащение полным текстом при заливке корпуса
|
FETCH_FULL_TEXT: bool = False # Включить обогащение полным текстом при заливке корпуса
|
||||||
|
|||||||
@@ -139,50 +139,64 @@ def extract_and_check(
|
|||||||
)
|
)
|
||||||
logger.info(f"Фрагментов создано: {len(fragments)}")
|
logger.info(f"Фрагментов создано: {len(fragments)}")
|
||||||
|
|
||||||
# ──── Уровень 1: Winnowing fingerprints ────────────────────────────────
|
# ──── Уровень 1: Winnowing fingerprints (пофрагментно, с локализацией) ───
|
||||||
|
# Winnow'им КАЖДЫЙ фрагмент отдельно и ищем, с каким источником и на
|
||||||
|
# какой позиции он совпадает. Так в отчёте видно не «документ похож на X»,
|
||||||
|
# а «фрагмент на символах A–B скопирован из источника X».
|
||||||
level1_matches: list[dict] = []
|
level1_matches: list[dict] = []
|
||||||
doc_fingerprint = winnow(text)
|
|
||||||
|
|
||||||
if doc_fingerprint:
|
|
||||||
from app.models import Document, Fingerprint
|
from app.models import Document, Fingerprint
|
||||||
|
|
||||||
with db_session() as session:
|
with db_session() as session:
|
||||||
hashes = list(doc_fingerprint)[: settings.MAX_FINGERPRINTS_PER_DOC]
|
doc_cache: dict[int, Document] = {}
|
||||||
|
|
||||||
# Найти совпадения в базе fingerprints
|
for frag in fragments:
|
||||||
matching_docs = session.execute(
|
frag_fp = winnow(frag["text"])
|
||||||
|
if not frag_fp:
|
||||||
|
continue
|
||||||
|
frag_hashes = list(frag_fp)
|
||||||
|
|
||||||
|
# Источник, разделяющий больше всего отпечатков с этим фрагментом
|
||||||
|
row = session.execute(
|
||||||
select(
|
select(
|
||||||
Fingerprint.doc_id,
|
Fingerprint.doc_id,
|
||||||
func.count(Fingerprint.id).label("match_count"),
|
func.count(Fingerprint.id).label("cnt"),
|
||||||
)
|
)
|
||||||
.where(Fingerprint.hash_value.in_(hashes))
|
.where(Fingerprint.hash_value.in_(frag_hashes))
|
||||||
.group_by(Fingerprint.doc_id)
|
.group_by(Fingerprint.doc_id)
|
||||||
.having(func.count(Fingerprint.id) > len(hashes) * 0.1)
|
|
||||||
.order_by(func.count(Fingerprint.id).desc())
|
.order_by(func.count(Fingerprint.id).desc())
|
||||||
.limit(20)
|
.limit(1)
|
||||||
).all()
|
).first()
|
||||||
|
|
||||||
for doc_id, match_count in matching_docs:
|
if row is None:
|
||||||
similarity = match_count / len(hashes) * 100
|
|
||||||
if similarity < 20:
|
|
||||||
continue
|
continue
|
||||||
|
|
||||||
|
doc_id, cnt = row
|
||||||
|
# Доля отпечатков фрагмента, найденных в источнике
|
||||||
|
similarity = cnt / len(frag_hashes) * 100
|
||||||
|
if similarity < settings.EXACT_FRAGMENT_THRESHOLD:
|
||||||
|
continue
|
||||||
|
|
||||||
|
doc = doc_cache.get(doc_id)
|
||||||
|
if doc is None:
|
||||||
doc = session.get(Document, doc_id)
|
doc = session.get(Document, doc_id)
|
||||||
if not doc:
|
if doc is None:
|
||||||
continue
|
continue
|
||||||
|
doc_cache[doc_id] = doc
|
||||||
|
|
||||||
level1_matches.append({
|
level1_matches.append({
|
||||||
"fragment": text[:200],
|
"fragment": frag["text"][:300],
|
||||||
"position_start": 0,
|
"position_start": frag["start"],
|
||||||
"position_end": len(text),
|
"position_end": frag["end"],
|
||||||
"similarity": round(similarity, 1),
|
"similarity": round(min(similarity, 100.0), 1),
|
||||||
"method": "exact",
|
"method": "exact",
|
||||||
"source_title": doc.title,
|
"source_title": doc.title,
|
||||||
"source_url": doc.url,
|
"source_url": doc.url,
|
||||||
"source_db": doc.source,
|
"source_db": doc.source,
|
||||||
})
|
})
|
||||||
|
|
||||||
logger.info(f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений")
|
logger.info(
|
||||||
|
f"Уровень 1 (Winnowing): {len(level1_matches)} совпадений-фрагментов"
|
||||||
|
)
|
||||||
|
|
||||||
# ──── Уровень 2: MinHash LSH ────────────────────────────────────────────
|
# ──── Уровень 2: MinHash LSH ────────────────────────────────────────────
|
||||||
level2_matches: list[dict] = []
|
level2_matches: list[dict] = []
|
||||||
|
|||||||
Reference in New Issue
Block a user