Раньше корпус состоял только из метаданных: парсеры отдают full_text=None,
fingerprints/эмбеддинги считались из аннотаций, MinIO статьями не наполнялся
вовсе. Проверка плагиата шла против абстрактов, а не тел статей.
Добавлено:
- app/fulltext.py: best-effort скачивание PDF по url источника (стрим с
лимитом размера, детект PDF по content-type/magic), извлечение текста
через PyMuPDF.
- index.enrich_full_text: новая задача — качает полный текст, кладёт в MinIO
(documents/corpus/{id}.txt), пересчитывает fingerprints по полному тексту,
обновляет MinHash. Диспатчится из add_document при FETCH_FULL_TEXT=true.
- openalex: предпочитаем прямую ссылку на PDF (best_oa_location.pdf_url)
вместо лендинга — покрытие full-text выросло с 17% до 33% на выборке.
- run_parser батчит эмбеддинги (EMBED_BATCH_SIZE) вместо диспатча по одному
документу: worker-gpu кодирует пачку разом и реже переписывает FAISS-индекс.
Покрытие ~33% (прямые OA-PDF: arxiv/usenix/springer/techscience и т.п.);
для остального остаётся фолбэк на аннотацию. Управляется FETCH_FULL_TEXT.
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
65 lines
2.4 KiB
Python
65 lines
2.4 KiB
Python
"""Конфигурация индексер-воркера."""
|
|
|
|
from pydantic_settings import BaseSettings, SettingsConfigDict
|
|
|
|
|
|
class Settings(BaseSettings):
|
|
"""Настройки индексер-воркера."""
|
|
|
|
model_config = SettingsConfigDict(
|
|
env_file=".env",
|
|
env_file_encoding="utf-8",
|
|
case_sensitive=False,
|
|
extra="ignore",
|
|
)
|
|
|
|
# PostgreSQL
|
|
POSTGRES_HOST: str = "postgres"
|
|
POSTGRES_PORT: int = 5432
|
|
POSTGRES_DB: str = "antiplagiator"
|
|
POSTGRES_USER: str = "antiplagiator"
|
|
POSTGRES_PASSWORD: str = "changeme"
|
|
|
|
# Redis
|
|
REDIS_URL: str = "redis://redis:6379/0"
|
|
|
|
# RabbitMQ
|
|
RABBITMQ_URL: str = "amqp://guest:guest@rabbitmq:5672/"
|
|
|
|
# MinIO
|
|
MINIO_ENDPOINT: str = "minio:9000"
|
|
MINIO_ACCESS_KEY: str = "minioadmin"
|
|
MINIO_SECRET_KEY: str = "changeme"
|
|
MINIO_BUCKET_DOCS: str = "documents"
|
|
MINIO_BUCKET_STAGING: str = "staging"
|
|
|
|
# Elasticsearch
|
|
ELASTICSEARCH_URL: str = "http://elasticsearch:9200"
|
|
|
|
# Настройки обработки текста
|
|
FRAGMENT_WINDOW_WORDS: int = 200 # Размер окна для фрагментов
|
|
FRAGMENT_OVERLAP_WORDS: int = 50 # Перекрытие фрагментов
|
|
MAX_FINGERPRINTS_PER_DOC: int = 500 # Максимум хэшей Winnowing на документ
|
|
|
|
# Скачивание полного текста статей (PDF по URL источника)
|
|
FETCH_FULL_TEXT: bool = False # Включить обогащение полным текстом при заливке корпуса
|
|
FULL_TEXT_TIMEOUT: float = 30.0 # Таймаут скачивания одного документа, сек
|
|
FULL_TEXT_MAX_BYTES: int = 30 * 1024 * 1024 # Лимит размера скачиваемого файла (30 МБ)
|
|
FULL_TEXT_MIN_CHARS: int = 500 # Минимум символов, иначе считаем извлечение неудачным
|
|
EMBED_BATCH_SIZE: int = 64 # Размер пачки документов для диспатча эмбеддингов
|
|
|
|
# App
|
|
ENVIRONMENT: str = "development"
|
|
DEBUG: bool = False
|
|
|
|
@property
|
|
def database_url_sync(self) -> str:
|
|
"""Синхронный URL для SQLAlchemy."""
|
|
return (
|
|
f"postgresql+psycopg2://{self.POSTGRES_USER}:{self.POSTGRES_PASSWORD}"
|
|
f"@{self.POSTGRES_HOST}:{self.POSTGRES_PORT}/{self.POSTGRES_DB}"
|
|
)
|
|
|
|
|
|
settings = Settings()
|