docs: сервер эмбеддингов переехал на .1.40 + честные итоги проверок
All checks were successful
Deploy / test (push) Successful in 2m59s
Deploy / deploy (push) Successful in 3s

Прод переключён на новый сервер эмбеддингов (VM 210 «embedding-cpu»,
192.168.1.40, хост pve2). Ключевое, чего не было в исходном плане переключения:
OLLAMA_URL живёт в Infisical, и deploy.sh генерирует .env из него на каждом
запуске — правка .env на сервере откатилась бы первым же деплоем.

Совместимость векторов проверена прямым сравнением, а не на слово: косинус
0.9999997, расхождение 1e-4 (округление AVX2 против AVX-512) — переиндексация
93 тыс. векторов не понадобилась.

Документация приведена в соответствие с фактами:
- ARCHITECTURE/DIAGRAM/README/CREDENTIALS: новый сервер, старый помечен как
  выведенный; убрано упоминание CUDA — GPU в проекте нет;
- DR-HA: эмбеддинги больше не висят на хосте .254, чьё падение 28.08 разом
  унесло брокер, прокси и секреты;
- INGESTION: исправлено собственное враньё про КиберЛенинку — «48 часов на
  100 тысяч» опровергнуто практикой, сайт блокирует выкачку после ~130 статей;
  снапшот OpenAlex вычеркнут как путь к миллионам (там только метаданные).

bulk_ingest_pmc.py: снята пометка «не закончен» — бага не было, первый прогон
упал уже после успешной вставки, а второй корректно пропустил дубли. Проверено:
100 статей, 183 090 отпечатков. Реальный темп 0.3 ст/с записан честно.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
jze9
2026-08-31 17:06:41 +05:00
parent 2d38dfd1f4
commit e4ca4a7150
6 changed files with 68 additions and 39 deletions

View File

@@ -25,12 +25,12 @@
залитые пропускаются. Прогресс листинга сохраняется в --state-file, поэтому
прерванная заливка продолжается с той же страницы бакета.
СТАТУС: НЕ ЗАКОНЧЕН. Проба на 200 статьях: документы вставляются верно
(проверено), но шаг отпечатков ошибочно считает свежевставленные документы уже
обработанными — проверка «есть ли отпечатки» срабатывает там, где их нет, и
COPY не выполняется. Пробные записи из базы удалены. До отладки этого места
скрипт запускать на объёме нельзя: он зальёт документы без отпечатков, то есть
невидимые для L1.
Проверено на проде 2026-08-31: 100 статей залито, 183 090 отпечатков (1831 на
статью — реальная глубина, а не аннотация). Темп — 0.3 статьи/с, то есть
миллион в один поток занял бы около 40 суток: скачивание тут не узкое место
(12 статей/с в 12 потоков), упирается в последовательную обработку одного
документа. Для миллионов обработку нужно распараллелить по ядрам воркера —
это следующий шаг, до него скрипт годится для порций в десятки тысяч.
"""
import argparse