add_document слал index.enrich_full_text для КАЖДОГО документа с url, даже когда full_text уже пришёл от парсера (у КиберЛенинки — OCR-фрагмент прямо в ответе поиска). Страница статьи там HTML, не PDF — enrich гарантированно ничего не находит, только тратит запрос впустую. При массовой заливке (десятки источников параллельно) это давало шквал запросов к чужому сайту и 503 в ответ — саму заливку не ломало, но съедало время и нагружало источник без всякой пользы.
27 KiB
27 KiB