feat: две доработки в духе коммерческих систем — цитаты и авто-корпус
Ответ на "неужели больше нет" / "мы ведь можем это исправить": закрывает
две дыры относительно Антиплагиат.ру/Turnitin, о которых договорились.
1. Различение цитаты и голого плагиата (app.scoring.is_cited, worker-gpu):
эвристика — фрагмент считается процитированным, если обрамлён кавычками
(«…», "…") либо сразу за ним (в пределах ~150 симв.) идёт скобочная ссылка
с годом: [Иванов, 2023], (Smith, 2020) — совпадает и с нашим же форматом
ГОСТ 7.0.5. aggregate_results теперь принимает full_text, размечает
match["cited"] и считает uncited_similarity (доля БЕЗ похожих на цитаты —
ближе к тому, что коммерческие системы называют "% некорректных
заимствований") отдельно от overall_similarity (как было, для совместимости).
Фронтенд: бейдж "Цитата" на совпадении + строка с разбивкой в отчёте
(аддитивные опциональные поля в типах — старые задачи не ломаются).
2. Автопополнение корпуса проверенными работами (как у коммерческих систем —
так ловится списывание у предыдущих потоков). Раньше загруженная на проверку
работа складывалась в StagedWork и ждала РУЧНОГО одобрения админом — де-факто
не пополняла базу для сравнения. Теперь index.auto_approve_submission
(диспатчится из gpu.check_plagiarism ПОСЛЕ сохранения результата — чтобы
работа не сматчилась сама с собой) добавляет её в documents автоматически,
под настройкой AUTO_APPROVE_SUBMISSIONS (default True). Ручное
approve/reject в админке остаётся рабочим (идемпотентно — auto-approve
пропускает уже не-pending записи), пригодится при AUTO_APPROVE=False.
Конвертация StagedWork→doc_data вынесена в чистый app/staging.py (без
Celery/SQLAlchemy/MinIO) — тестируется изолированно, идентична ручному
пути в admin.py (POST /admin/staging/{id}/approve).
Тестов добавлено 16 (scoring 8→18, новый staging.py — 6). Оба mypy-гейта
расширены (scoring.py, staging.py). Тестов всего: 112 (было 82 в последнем
подсчёте README — таблица давно отставала, заодно поправил на актуальные цифры
по всем сервисам, включая забытый в прошлый раз Qdrant).
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
12
README.md
12
README.md
@@ -208,8 +208,9 @@ docker compose -f docker-compose.prod.yml --profile observability up -d promethe
|
||||
|
||||
1. **Линт** — `ruff` (весь Python) + `mypy` (чистая доменная логика).
|
||||
Конфиги: [`ruff.toml`](ruff.toml), [`mypy.ini`](mypy.ini).
|
||||
2. **Юнит-тесты** — `pytest` по сервисам: 73 теста на ядро детекции и форматирования,
|
||||
без внешней инфры (БД/Redis/GPU/Ollama замоканы либо не нужны).
|
||||
2. **Юнит-тесты** — `pytest` по сервисам: 112 тестов на ядро детекции, скоринга,
|
||||
парсеров и форматирования, без внешней инфры (БД/Redis/GPU/Ollama замоканы
|
||||
либо не нужны).
|
||||
|
||||
```bash
|
||||
make lint # ruff + mypy в изолированном контейнере
|
||||
@@ -229,11 +230,14 @@ make test-one SVC=worker-gost # тесты одного сервиса
|
||||
| L1 — точные совпадения | `worker-indexer/app/algorithms/winnowing.py` | 13 |
|
||||
| L2 — нечёткие (MinHash LSH) | `worker-indexer/app/algorithms/minhash.py` | 6 |
|
||||
| Разбиение на фрагменты | `worker-indexer/app/fragments.py` | 5 |
|
||||
| L3 — семантический индекс | `worker-gpu/app/faiss_manager.py` | 5 |
|
||||
| Автопополнение корпуса | `worker-indexer/app/staging.py` | 6 |
|
||||
| L3 — семантический индекс (FAISS) | `worker-gpu/app/faiss_manager.py` | 5 |
|
||||
| L3 — векторный бэкенд (Qdrant + выбор) | `worker-gpu/app/qdrant_manager.py`, `vector_store.py` | 9 |
|
||||
| L4 — LLM-парафраз | `worker-gpu/app/ollama_client.py` | 12 |
|
||||
| Итоговый % плагиата | `worker-gpu/app/scoring.py` | 8 |
|
||||
| Итоговый % плагиата + цитаты | `worker-gpu/app/scoring.py` | 18 |
|
||||
| ГОСТ 7.1 / 7.0.5 | `worker-gost/app/formatters/` | 17 |
|
||||
| Список литературы | `worker-gost/app/bibliography.py` | 7 |
|
||||
| Парсеры источников (CyberLeninka, PMC) | `scripts/parsers/` | 14 |
|
||||
|
||||
## Лицензия
|
||||
|
||||
|
||||
Reference in New Issue
Block a user