feat(embeddings): добавить облачный бэкенд (DeepInfra, та же bge-m3)
All checks were successful
Deploy / test (push) Successful in 4m29s
Deploy / deploy (push) Successful in 59s

EMBED_BACKEND=cloud — эмбеддинги через DeepInfra (OpenAI-совместимый API),
модель та же BAAI/bge-m3, что уже льётся на VM109 — переключение не рвёт
совместимость с уже пересчитанным FAISS-индексом (тот же вектор 1024).
Не активно по умолчанию (EMBED_BACKEND всё ещё "ollama").
This commit is contained in:
jze9
2026-08-26 17:18:11 +05:00
parent 96a4530a93
commit c156fb2b78
2 changed files with 35 additions and 2 deletions

View File

@@ -49,13 +49,19 @@ class Settings(BaseSettings):
# FAISS / ML
FAISS_INDEX_PATH: str = "/data/index/faiss.index"
FAISS_ID_MAP_PATH: str = "/data/index/faiss_id_map.json"
# EMBED_BACKEND: "ollama" (GGUF-модель через Vulkan, для AMD GPU без ROCm/atomics)
# или "sentence_transformers" (локальная загрузка, CUDA/CPU)
# EMBED_BACKEND: "ollama" (GGUF-модель через Vulkan, для AMD GPU без ROCm/atomics),
# "sentence_transformers" (локальная загрузка, CUDA/CPU) или "cloud" (облачный
# инференс той же модели — не нужен вообще никакой локальный GPU).
EMBED_BACKEND: str = "ollama"
EMBED_MODEL: str = "bge-m3"
EMBED_DEVICE: str = "cuda" # используется только при EMBED_BACKEND=sentence_transformers
EMBED_BATCH_SIZE: int = 64
EMBED_DIM: int = 1024 # bge-m3; было 768 у paraphrase-multilingual-mpnet-base-v2
# DeepInfra — OpenAI-совместимый инференс BAAI/bge-m3 в облаке, та же модель,
# что и на VM109, дешёвый пей-пер-токен. Используется при EMBED_BACKEND=cloud.
CLOUD_EMBED_URL: str = "https://api.deepinfra.com/v1/openai/embeddings"
CLOUD_EMBED_MODEL: str = "BAAI/bge-m3"
CLOUD_EMBED_API_KEY: str = ""
FAISS_NLIST: int = 1024 # Количество кластеров для IVFFlat
FAISS_NPROBE: int = 64 # Количество кластеров для поиска