feat(admin): шкала загрузки источников, отладка и загрузка работ в корпус
Заливка корпуса была чёрным ящиком: у источника только last_status (idle/running/done/error), без «сколько из скольки», без причины падения и без способа остановить начатое. Теперь каждый запуск создаёт строку parse_runs, куда воркер раз в ~2с пишет стадию, счётчики и журнал событий. Админка: - шкала загрузки у каждого источника (0→50% выборка, 50→100% индексация), раскрытая строка — журнал прогона по шагам с таймингами; - «Запустить всё» / «Остановить всё» и остановка по одному источнику (кооперативная отмена: воркер останавливается сам, не рвя запись в базу); - пакетное добавление источников (тип + список тем), тип pmc в форме; - загрузка PDF/DOCX/TXT прямо в базу сравнения (index.ingest_upload); - страница «Отладка»: воркеры Celery и их текущие таски, очереди RabbitMQ, покрытие корпуса эмбеддингами, зависшие и упавшие прогоны, конфиг бэкендов. Защита от краш-лупа по consumer_timeout RabbitMQ (docs/DR-HA.md §6), без неё массовый запуск 170+ источников гарантированно ронял воркер: - PARSER_TIME_BUDGET_S (1500с) — прогон закругляется сам и помечается partial; - worker_prefetch_multiplier=1 — таймаут считается от ДОСТАВКИ сообщения, и с дефолтным префетчем очередь долгих run_parser убивала канал на задачах, которые ещё не начинались. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
@@ -14,11 +14,9 @@
|
||||
(русскоязычные, CyberLeninka/OpenAlex `lang=ru`) и **`scripts/seed_broad_corpus.py`**
|
||||
(англоязычные — OpenAlex/arXiv/PMC по широкому списку дисциплин, добавлен позже
|
||||
первой волны).
|
||||
- Известный операционный риск при массовой докачке: retry-бэкофф на 429 от OpenAlex
|
||||
не должен по сумме ожиданий превышать `consumer_timeout` RabbitMQ (по умолчанию
|
||||
1800с) — иначе брокер рвёт канал до того, как таск успевает сдаться, и
|
||||
`worker-indexer` уходит в бесконечный краш-луп на редоставленном сообщении
|
||||
(см. `scripts/parsers/openalex.py`, `MAX_RATE_LIMIT_RETRIES`).
|
||||
- Операционный риск массовой докачки (`consumer_timeout` RabbitMQ vs долгие таски)
|
||||
закрыт бюджетом времени прогона и `worker_prefetch_multiplier=1` — подробности
|
||||
и почему префетч тут главный, см. [DR-HA.md](DR-HA.md) §6.
|
||||
|
||||
## Что подготовлено
|
||||
|
||||
@@ -42,10 +40,31 @@ python scripts/seed_ru_sources.py
|
||||
python scripts/seed_ru_sources.py --apply --limit 500
|
||||
|
||||
# 2. Проверить пару источников на темпе/качестве, затем запустить заливку:
|
||||
# • Админ-панель → «Источники» → «Запустить», ЛИБО
|
||||
# • Админ-панель → «Источники» → «Запустить» (или «Запустить всё»), ЛИБО
|
||||
# • Celery: index.run_parser.delay(source_id) по каждому id
|
||||
```
|
||||
|
||||
## Управление заливкой из админки
|
||||
|
||||
Всё, что ниже, доступно на странице «Источники» — CLI для этого больше не нужен:
|
||||
|
||||
- **Шкала загрузки** у каждого источника: стадия (выборка → индексация), сколько
|
||||
получено из скольки, сколько добавлено/дублей/ошибок. Раскрытая строка —
|
||||
журнал прогона по шагам с таймингами (таблица `parse_runs`).
|
||||
- **«Запустить всё»** — прогон по всем включённым источникам; уже идущие
|
||||
пропускаются. **«Остановить всё»** и остановка по одному — кооперативная
|
||||
отмена: воркер останавливается сам на ближайшем тике, не обрывая запись в базу.
|
||||
- **Пакетное добавление** — один тип источника + список тем (по строке),
|
||||
опционально с немедленным запуском. Заменяет `seed_*.py` для разовых расширений.
|
||||
- **Загрузка работ в базу** — PDF/DOCX/TXT прямо в корпус сравнения
|
||||
(`index.ingest_upload`, `source=manual_upload`), минуя проверку и отстойник.
|
||||
- **Страница «Отладка»** — очереди, воркеры, покрытие эмбеддингами, зависшие и
|
||||
упавшие прогоны (см. ARCHITECTURE.md §12).
|
||||
|
||||
Прогон со статусом `partial` — это не ошибка: сработал бюджет времени
|
||||
(`PARSER_TIME_BUDGET_S`, 1500с), заливка остановилась раньше `consumer_timeout`
|
||||
RabbitMQ. Остаток добирается повторным запуском источника.
|
||||
|
||||
Заливка сама: fetch (rate-limit 1 req/s) → `add_document` (дедуп по `ext_id`,
|
||||
fingerprints L1, MinHash L2) → батч-эмбеддинги `gpu.embed_documents` (L3). ~30 тем ×
|
||||
500 ≈ 15K русских документов на первый заход.
|
||||
|
||||
Reference in New Issue
Block a user