feat(embeddings): переключить эмбеддинги на Ollama/bge-m3 (GPU через Vulkan)
Раньше эмбеддинг-модель (уровень 3) гоняла на CPU внутри worker-gpu —
GPU CT108 использовался только под LLM-парафраз (уровень 4). Теперь
эмбеддинги идут через Ollama /api/embed на отдельной VM с RX 580
(Vulkan-бэкенд, без возни с ROCm/HIP для этой карты). EMBED_BACKEND
переключаемый ("ollama" | "sentence_transformers"), дефолт — ollama.
Модель сменилась на bge-m3 (1024-мерный вектор вместо 768 у
paraphrase-multilingual-mpnet-base-v2) — несовместимо с уже посчитанным
FAISS-индексом, нужна полная переиндексация корпуса после деплоя.
Заодно докстринг delete_task в tasks.py — снятое раньше ограничение
"нельзя удалить processing" оставляло враньё в докстринге.
This commit is contained in:
@@ -41,10 +41,13 @@ class Settings(BaseSettings):
|
||||
# FAISS / ML
|
||||
FAISS_INDEX_PATH: str = "/data/index/faiss.index"
|
||||
FAISS_ID_MAP_PATH: str = "/data/index/faiss_id_map.json"
|
||||
EMBED_MODEL: str = "paraphrase-multilingual-mpnet-base-v2"
|
||||
EMBED_DEVICE: str = "cuda"
|
||||
# EMBED_BACKEND: "ollama" (GGUF-модель через Vulkan, для AMD GPU без ROCm/atomics)
|
||||
# или "sentence_transformers" (локальная загрузка, CUDA/CPU)
|
||||
EMBED_BACKEND: str = "ollama"
|
||||
EMBED_MODEL: str = "bge-m3"
|
||||
EMBED_DEVICE: str = "cuda" # используется только при EMBED_BACKEND=sentence_transformers
|
||||
EMBED_BATCH_SIZE: int = 64
|
||||
EMBED_DIM: int = 768 # Размерность вектора paraphrase-multilingual-mpnet-base-v2
|
||||
EMBED_DIM: int = 1024 # bge-m3; было 768 у paraphrase-multilingual-mpnet-base-v2
|
||||
FAISS_NLIST: int = 1024 # Количество кластеров для IVFFlat
|
||||
FAISS_NPROBE: int = 64 # Количество кластеров для поиска
|
||||
|
||||
|
||||
Reference in New Issue
Block a user