feat(embeddings): добавить облачный бэкенд (DeepInfra, та же bge-m3)
EMBED_BACKEND=cloud — эмбеддинги через DeepInfra (OpenAI-совместимый API), модель та же BAAI/bge-m3, что уже льётся на VM109 — переключение не рвёт совместимость с уже пересчитанным FAISS-индексом (тот же вектор 1024). Не активно по умолчанию (EMBED_BACKEND всё ещё "ollama").
This commit is contained in:
@@ -49,13 +49,19 @@ class Settings(BaseSettings):
|
||||
# FAISS / ML
|
||||
FAISS_INDEX_PATH: str = "/data/index/faiss.index"
|
||||
FAISS_ID_MAP_PATH: str = "/data/index/faiss_id_map.json"
|
||||
# EMBED_BACKEND: "ollama" (GGUF-модель через Vulkan, для AMD GPU без ROCm/atomics)
|
||||
# или "sentence_transformers" (локальная загрузка, CUDA/CPU)
|
||||
# EMBED_BACKEND: "ollama" (GGUF-модель через Vulkan, для AMD GPU без ROCm/atomics),
|
||||
# "sentence_transformers" (локальная загрузка, CUDA/CPU) или "cloud" (облачный
|
||||
# инференс той же модели — не нужен вообще никакой локальный GPU).
|
||||
EMBED_BACKEND: str = "ollama"
|
||||
EMBED_MODEL: str = "bge-m3"
|
||||
EMBED_DEVICE: str = "cuda" # используется только при EMBED_BACKEND=sentence_transformers
|
||||
EMBED_BATCH_SIZE: int = 64
|
||||
EMBED_DIM: int = 1024 # bge-m3; было 768 у paraphrase-multilingual-mpnet-base-v2
|
||||
# DeepInfra — OpenAI-совместимый инференс BAAI/bge-m3 в облаке, та же модель,
|
||||
# что и на VM109, дешёвый пей-пер-токен. Используется при EMBED_BACKEND=cloud.
|
||||
CLOUD_EMBED_URL: str = "https://api.deepinfra.com/v1/openai/embeddings"
|
||||
CLOUD_EMBED_MODEL: str = "BAAI/bge-m3"
|
||||
CLOUD_EMBED_API_KEY: str = ""
|
||||
FAISS_NLIST: int = 1024 # Количество кластеров для IVFFlat
|
||||
FAISS_NPROBE: int = 64 # Количество кластеров для поиска
|
||||
|
||||
|
||||
Reference in New Issue
Block a user