feat: две доработки в духе коммерческих систем — цитаты и авто-корпус
Some checks failed
Deploy / test (push) Failing after 4m15s
Deploy / deploy (push) Has been skipped

Ответ на "неужели больше нет" / "мы ведь можем это исправить": закрывает
две дыры относительно Антиплагиат.ру/Turnitin, о которых договорились.

1. Различение цитаты и голого плагиата (app.scoring.is_cited, worker-gpu):
   эвристика — фрагмент считается процитированным, если обрамлён кавычками
   («…», "…") либо сразу за ним (в пределах ~150 симв.) идёт скобочная ссылка
   с годом: [Иванов, 2023], (Smith, 2020) — совпадает и с нашим же форматом
   ГОСТ 7.0.5. aggregate_results теперь принимает full_text, размечает
   match["cited"] и считает uncited_similarity (доля БЕЗ похожих на цитаты —
   ближе к тому, что коммерческие системы называют "% некорректных
   заимствований") отдельно от overall_similarity (как было, для совместимости).
   Фронтенд: бейдж "Цитата" на совпадении + строка с разбивкой в отчёте
   (аддитивные опциональные поля в типах — старые задачи не ломаются).

2. Автопополнение корпуса проверенными работами (как у коммерческих систем —
   так ловится списывание у предыдущих потоков). Раньше загруженная на проверку
   работа складывалась в StagedWork и ждала РУЧНОГО одобрения админом — де-факто
   не пополняла базу для сравнения. Теперь index.auto_approve_submission
   (диспатчится из gpu.check_plagiarism ПОСЛЕ сохранения результата — чтобы
   работа не сматчилась сама с собой) добавляет её в documents автоматически,
   под настройкой AUTO_APPROVE_SUBMISSIONS (default True). Ручное
   approve/reject в админке остаётся рабочим (идемпотентно — auto-approve
   пропускает уже не-pending записи), пригодится при AUTO_APPROVE=False.
   Конвертация StagedWork→doc_data вынесена в чистый app/staging.py (без
   Celery/SQLAlchemy/MinIO) — тестируется изолированно, идентична ручному
   пути в admin.py (POST /admin/staging/{id}/approve).

Тестов добавлено 16 (scoring 8→18, новый staging.py — 6). Оба mypy-гейта
расширены (scoring.py, staging.py). Тестов всего: 112 (было 82 в последнем
подсчёте README — таблица давно отставала, заодно поправил на актуальные цифры
по всем сервисам, включая забытый в прошлый раз Qdrant).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
jze9
2026-08-24 15:09:43 +05:00
parent 92a1ce0f57
commit b471ec767a
11 changed files with 335 additions and 19 deletions

View File

@@ -0,0 +1,51 @@
"""Юнит-тесты преобразования StagedWork → doc_data (автопополнение корпуса)."""
from dataclasses import dataclass
from app.staging import staged_work_to_doc_data
@dataclass
class _SW:
id: int
title: str | None = None
filename: str | None = None
authors: list | None = None
year: int | None = None
lang: str | None = None
def test_ext_id_is_prefixed_with_staged():
d = staged_work_to_doc_data(_SW(id=42), "текст")
assert d["ext_id"] == "staged:42"
def test_source_is_user_submission():
d = staged_work_to_doc_data(_SW(id=1), "текст")
assert d["source"] == "user_submission"
def test_title_falls_back_to_filename_then_placeholder():
assert staged_work_to_doc_data(_SW(id=1, title="Заголовок"), "т")["title"] == "Заголовок"
assert staged_work_to_doc_data(_SW(id=1, filename="work.pdf"), "т")["title"] == "work.pdf"
assert staged_work_to_doc_data(_SW(id=7), "т")["title"] == "Работа #7"
def test_authors_defaults_to_empty_list():
assert staged_work_to_doc_data(_SW(id=1), "т")["authors"] == []
assert staged_work_to_doc_data(_SW(id=1, authors=[{"last_name": "X"}]), "т")["authors"] == [
{"last_name": "X"}
]
def test_full_text_preserved_abstract_truncated_to_2000():
long_text = "с" * 3000
d = staged_work_to_doc_data(_SW(id=1), long_text)
assert d["full_text"] == long_text
assert len(d["abstract"]) == 2000
def test_year_and_lang_passed_through():
d = staged_work_to_doc_data(_SW(id=1, year=2024, lang="ru"), "т")
assert d["year"] == 2024
assert d["lang"] == "ru"