fix(embeddings): не терять батч на таймауте Ollama, уменьшить пачку
Ollama обрабатывает тексты в пачке последовательно (один "slot" в llama.cpp, не параллельно) — 64 реальных документа в одном HTTP-запросе регулярно не укладывались в 120с, весь батч падал с ReadTimeout и терялся без ретрая (embed_documents была без bind/max_retries). Теперь: пачка 16, таймаут 300с, задача ретраится до 3 раз при сбое.
This commit is contained in:
@@ -58,7 +58,10 @@ class Settings(BaseSettings):
|
||||
EMBED_BACKEND: str = "ollama"
|
||||
EMBED_MODEL: str = "bge-m3"
|
||||
EMBED_DEVICE: str = "cuda" # используется только при EMBED_BACKEND=sentence_transformers
|
||||
EMBED_BATCH_SIZE: int = 64
|
||||
# Ollama обрабатывает тексты в пачке последовательно (один "slot" в llama.cpp,
|
||||
# не параллельно) — 64 реальных документа в один HTTP-запрос регулярно не
|
||||
# укладывались в таймаут. Меньше пачка — короче и надёжнее каждый запрос.
|
||||
EMBED_BATCH_SIZE: int = 16
|
||||
EMBED_DIM: int = 1024 # bge-m3; было 768 у paraphrase-multilingual-mpnet-base-v2
|
||||
# DeepInfra — OpenAI-совместимый инференс BAAI/bge-m3 в облаке, та же модель,
|
||||
# что и на VM109, дешёвый пей-пер-токен. Используется при EMBED_BACKEND=cloud.
|
||||
|
||||
Reference in New Issue
Block a user