fix(embeddings): не терять батч на таймауте Ollama, уменьшить пачку
Ollama обрабатывает тексты в пачке последовательно (один "slot" в llama.cpp, не параллельно) — 64 реальных документа в одном HTTP-запросе регулярно не укладывались в 120с, весь батч падал с ReadTimeout и терялся без ретрая (embed_documents была без bind/max_retries). Теперь: пачка 16, таймаут 300с, задача ретраится до 3 раз при сбое.
This commit is contained in:
@@ -91,7 +91,10 @@ class ModelManager:
|
||||
response = httpx.post(
|
||||
f"{settings.OLLAMA_URL}/api/embed",
|
||||
json={"model": settings.EMBED_MODEL, "input": batch},
|
||||
timeout=120.0,
|
||||
timeout=300.0, # Ollama обрабатывает тексты в пачке последовательно
|
||||
# (виден один "slot" в логах llama.cpp), не параллельно — на реальных
|
||||
# (не тестовых) текстах 64 шт. в 120с не укладывались, отсюда ReadTimeout
|
||||
# и потеря батча целиком (без ретрая).
|
||||
)
|
||||
response.raise_for_status()
|
||||
all_vectors.extend(response.json()["embeddings"])
|
||||
|
||||
Reference in New Issue
Block a user