feat: две доработки в духе коммерческих систем — цитаты и авто-корпус
Ответ на "неужели больше нет" / "мы ведь можем это исправить": закрывает
две дыры относительно Антиплагиат.ру/Turnitin, о которых договорились.
1. Различение цитаты и голого плагиата (app.scoring.is_cited, worker-gpu):
эвристика — фрагмент считается процитированным, если обрамлён кавычками
(«…», "…") либо сразу за ним (в пределах ~150 симв.) идёт скобочная ссылка
с годом: [Иванов, 2023], (Smith, 2020) — совпадает и с нашим же форматом
ГОСТ 7.0.5. aggregate_results теперь принимает full_text, размечает
match["cited"] и считает uncited_similarity (доля БЕЗ похожих на цитаты —
ближе к тому, что коммерческие системы называют "% некорректных
заимствований") отдельно от overall_similarity (как было, для совместимости).
Фронтенд: бейдж "Цитата" на совпадении + строка с разбивкой в отчёте
(аддитивные опциональные поля в типах — старые задачи не ломаются).
2. Автопополнение корпуса проверенными работами (как у коммерческих систем —
так ловится списывание у предыдущих потоков). Раньше загруженная на проверку
работа складывалась в StagedWork и ждала РУЧНОГО одобрения админом — де-факто
не пополняла базу для сравнения. Теперь index.auto_approve_submission
(диспатчится из gpu.check_plagiarism ПОСЛЕ сохранения результата — чтобы
работа не сматчилась сама с собой) добавляет её в documents автоматически,
под настройкой AUTO_APPROVE_SUBMISSIONS (default True). Ручное
approve/reject в админке остаётся рабочим (идемпотентно — auto-approve
пропускает уже не-pending записи), пригодится при AUTO_APPROVE=False.
Конвертация StagedWork→doc_data вынесена в чистый app/staging.py (без
Celery/SQLAlchemy/MinIO) — тестируется изолированно, идентична ручному
пути в admin.py (POST /admin/staging/{id}/approve).
Тестов добавлено 16 (scoring 8→18, новый staging.py — 6). Оба mypy-гейта
расширены (scoring.py, staging.py). Тестов всего: 112 (было 82 в последнем
подсчёте README — таблица давно отставала, заодно поправил на актуальные цифры
по всем сервисам, включая забытый в прошлый раз Qdrant).
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -59,6 +59,13 @@ class Settings(BaseSettings):
|
||||
FULL_TEXT_MIN_CHARS: int = 500 # Минимум символов, иначе считаем извлечение неудачным
|
||||
EMBED_BATCH_SIZE: int = 64 # Размер пачки документов для диспатча эмбеддингов
|
||||
|
||||
# Автоматически добавлять проверенные работы студентов в базу для сравнения
|
||||
# (как в коммерческих системах — Антиплагиат.ру/Turnitin ловят списывание у
|
||||
# предыдущих потоков именно так). Без этого каждая работа лежит в StagedWork
|
||||
# и ждёт ручного одобрения админом — сейчас это дефолт для роста корпуса;
|
||||
# выключить, если нужна модерация перед публикацией.
|
||||
AUTO_APPROVE_SUBMISSIONS: bool = True
|
||||
|
||||
# App
|
||||
ENVIRONMENT: str = "development"
|
||||
DEBUG: bool = False
|
||||
|
||||
40
services/worker-indexer/app/staging.py
Normal file
40
services/worker-indexer/app/staging.py
Normal file
@@ -0,0 +1,40 @@
|
||||
"""Преобразование StagedWork → doc_data для add_document — чистая логика.
|
||||
|
||||
Формат идентичен ручному одобрению в админке (POST /admin/staging/{id}/approve),
|
||||
чтобы автоматический путь (auto_approve_submission) и ручной давали одинаковый
|
||||
результат. Без зависимости от SQLAlchemy/Celery/MinIO — принимает любой объект с
|
||||
нужными атрибутами (StagedWork ORM или эквивалент), тестируется изолированно.
|
||||
"""
|
||||
|
||||
from typing import Any, Protocol
|
||||
|
||||
|
||||
class StagedWorkLike(Protocol):
|
||||
id: int
|
||||
title: str | None
|
||||
filename: str | None
|
||||
authors: list | None
|
||||
year: int | None
|
||||
lang: str | None
|
||||
|
||||
|
||||
def staged_work_to_doc_data(sw: StagedWorkLike, full_text: str) -> dict[str, Any]:
|
||||
"""Собрать doc_data для index.add_document из записи StagedWork.
|
||||
|
||||
Args:
|
||||
sw: StagedWork (или объект с теми же атрибутами)
|
||||
full_text: извлечённый текст работы (уже прочитан из MinIO)
|
||||
|
||||
Returns:
|
||||
dict в формате, который ожидает add_document (source, ext_id, title, ...)
|
||||
"""
|
||||
return {
|
||||
"source": "user_submission",
|
||||
"ext_id": f"staged:{sw.id}",
|
||||
"title": sw.title or sw.filename or f"Работа #{sw.id}",
|
||||
"authors": sw.authors or [],
|
||||
"year": sw.year,
|
||||
"lang": sw.lang,
|
||||
"abstract": full_text[:2000],
|
||||
"full_text": full_text,
|
||||
}
|
||||
@@ -1,7 +1,7 @@
|
||||
"""Celery задачи индексации документов и проверки плагиата (уровни 1-2)."""
|
||||
|
||||
import io
|
||||
from datetime import UTC
|
||||
from datetime import UTC, datetime
|
||||
from pathlib import Path
|
||||
from typing import Any
|
||||
|
||||
@@ -17,6 +17,7 @@ from app.db import db_session, get_minio, update_task_status
|
||||
from app.extractors.docx import extract_text_from_docx, extract_text_from_txt
|
||||
from app.extractors.pdf import extract_text_from_pdf
|
||||
from app.fragments import split_into_fragments
|
||||
from app.staging import staged_work_to_doc_data
|
||||
|
||||
logger = get_task_logger(__name__)
|
||||
|
||||
@@ -390,6 +391,56 @@ def enrich_full_text(self, doc_id: int, url: str) -> dict[str, Any]:
|
||||
return {"status": "ok", "doc_id": doc_id, "chars": len(text), "fingerprints": len(hashes)}
|
||||
|
||||
|
||||
@celery_app.task(
|
||||
name="index.auto_approve_submission",
|
||||
bind=True,
|
||||
max_retries=2,
|
||||
default_retry_delay=60,
|
||||
)
|
||||
def auto_approve_submission(self, task_id: str) -> dict[str, Any]:
|
||||
"""Автоматически добавить проверенную работу студента в базу для сравнения.
|
||||
|
||||
Вызывается из gpu.check_plagiarism ПОСЛЕ сохранения результата проверки —
|
||||
так работа не сматчится сама с собой. Идемпотентно: пропускает, если
|
||||
StagedWork не 'pending' (уже одобрена/отклонена вручную или повторный вызов)
|
||||
или если AUTO_APPROVE_SUBMISSIONS выключен настройкой — тогда работа так и
|
||||
остаётся ждать ручного решения в админке.
|
||||
"""
|
||||
from app.models import StagedWork
|
||||
|
||||
if not settings.AUTO_APPROVE_SUBMISSIONS:
|
||||
return {"status": "skipped", "reason": "auto-approve выключен настройкой"}
|
||||
|
||||
with db_session() as session:
|
||||
sw = session.execute(
|
||||
select(StagedWork).where(StagedWork.task_id == task_id)
|
||||
).scalar_one_or_none()
|
||||
if sw is None:
|
||||
return {"status": "skipped", "reason": "StagedWork не найден"}
|
||||
if sw.status != "pending":
|
||||
return {"status": "skipped", "reason": f"уже {sw.status}"}
|
||||
|
||||
full_text = ""
|
||||
if sw.text_key:
|
||||
try:
|
||||
minio = get_minio()
|
||||
obj = minio.get_object(settings.MINIO_BUCKET_STAGING, sw.text_key)
|
||||
full_text = obj.read().decode("utf-8", errors="replace")
|
||||
except Exception as e:
|
||||
logger.warning(f"auto_approve_submission: не прочитан текст {task_id!r}: {e}")
|
||||
return {"status": "error", "reason": str(e)}
|
||||
|
||||
doc_data = staged_work_to_doc_data(sw, full_text)
|
||||
sw.status = "approved"
|
||||
sw.reviewed_by = None # None = одобрено автоматически, не человеком
|
||||
sw.reviewed_at = datetime.now(UTC)
|
||||
session.commit()
|
||||
|
||||
result = add_document(doc_data, dispatch_embed=True)
|
||||
logger.info(f"auto_approve_submission: задача {task_id!r} → {result}")
|
||||
return result
|
||||
|
||||
|
||||
def _stage_work(
|
||||
task_id: str,
|
||||
minio_key: str,
|
||||
|
||||
Reference in New Issue
Block a user