chore(lint): ruff-гейт в CI + фиксы (0 находок) — блокирует кривой деплой
Второй CI-гейт после тестов: ruff как статический анализатор всего Python-кода (services + scripts). Раньше ни линта, ни проверки типов в CI не было вовсе. Конфиг ruff.toml: правила E/F/W/I/UP/B/SIM/C4, line-length 100. Осознанно выключены E501 (длину держит форматтер; длинные RU-комментарии — норма), B008 (Depends()/Query() в дефолтах — идиома FastAPI, не баг) и UP042 ((str, Enum)→StrEnum меняет __str__/сериализацию — не трогаем). Починено под ноль находок: - B904 (11): raise ... from exc / from None — читаемые цепочки исключений в Celery-ретраях и HTTPException, ошибки обработки не маскируют исходные. - SIM105 (5): try/except/pass → contextlib.suppress (faiss remove_ids, lsh.remove, сброс кэша, ws-disconnect, парс года). - C416/SIM108/B905/F841/UP035/UP017/F401/I001: dict(rows), тернарник, zip strict, мёртвая переменная, устаревшие импорты, timezone.utc→UTC, чистка/сортировка. Обвязка: scripts/run_lint.sh (ruff в изолированном python:3.11-slim), шаг «Линт» в job test перед юнит-тестами (падаем раньше). make lint / make lint-fix. Все 41 юнит-тест по-прежнему зелёные, изменённые файлы компилируются. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -9,6 +9,7 @@
|
||||
локальный и теряется при рестарте), чтобы воркер не падал целиком.
|
||||
"""
|
||||
|
||||
import contextlib
|
||||
import logging
|
||||
from urllib.parse import urlparse
|
||||
|
||||
@@ -118,10 +119,8 @@ def add_to_lsh(doc_key: str, text: str) -> None:
|
||||
lsh = get_lsh()
|
||||
m = text_to_minhash(text)
|
||||
try:
|
||||
try:
|
||||
lsh.remove(doc_key) # снять прежнюю версию, если была
|
||||
except Exception:
|
||||
pass # ключа не было — это норма
|
||||
with contextlib.suppress(Exception):
|
||||
lsh.remove(doc_key) # снять прежнюю версию, если была (ключа могло не быть)
|
||||
lsh.insert(doc_key, m)
|
||||
except Exception as e:
|
||||
logger.warning(f"MinHash LSH: не удалось добавить {doc_key!r}: {e}")
|
||||
|
||||
@@ -1,8 +1,8 @@
|
||||
"""Синхронное подключение к PostgreSQL и MinIO для индексер-воркера."""
|
||||
|
||||
import logging
|
||||
from collections.abc import Generator
|
||||
from contextlib import contextmanager
|
||||
from typing import Generator
|
||||
|
||||
from minio import Minio
|
||||
from sqlalchemy import create_engine
|
||||
|
||||
@@ -22,7 +22,6 @@ def extract_text_from_docx(data: bytes) -> str:
|
||||
ValueError: Если не удалось открыть DOCX
|
||||
"""
|
||||
from docx import Document as DocxDocument
|
||||
from docx.oxml.ns import qn
|
||||
|
||||
try:
|
||||
doc = DocxDocument(io.BytesIO(data))
|
||||
|
||||
@@ -38,22 +38,21 @@ def fetch_full_text(url: str) -> str | None:
|
||||
follow_redirects=True,
|
||||
timeout=settings.FULL_TEXT_TIMEOUT,
|
||||
headers=_HEADERS,
|
||||
) as client:
|
||||
with client.stream("GET", url) as resp:
|
||||
resp.raise_for_status()
|
||||
ctype = resp.headers.get("content-type", "").lower()
|
||||
) as client, client.stream("GET", url) as resp:
|
||||
resp.raise_for_status()
|
||||
ctype = resp.headers.get("content-type", "").lower()
|
||||
|
||||
# Скачиваем с ограничением размера
|
||||
buf = bytearray()
|
||||
for chunk in resp.iter_bytes():
|
||||
buf += chunk
|
||||
if len(buf) > settings.FULL_TEXT_MAX_BYTES:
|
||||
logger.info(
|
||||
f"full-text превысил лимит {settings.FULL_TEXT_MAX_BYTES} байт, "
|
||||
f"обрезаю: {url}"
|
||||
)
|
||||
break
|
||||
data = bytes(buf)
|
||||
# Скачиваем с ограничением размера
|
||||
buf = bytearray()
|
||||
for chunk in resp.iter_bytes():
|
||||
buf += chunk
|
||||
if len(buf) > settings.FULL_TEXT_MAX_BYTES:
|
||||
logger.info(
|
||||
f"full-text превысил лимит {settings.FULL_TEXT_MAX_BYTES} байт, "
|
||||
f"обрезаю: {url}"
|
||||
)
|
||||
break
|
||||
data = bytes(buf)
|
||||
except Exception as e:
|
||||
logger.info(f"full-text: скачать не удалось {url!r}: {type(e).__name__}: {str(e)[:120]}")
|
||||
return None
|
||||
|
||||
@@ -1,7 +1,7 @@
|
||||
"""Celery задачи индексации документов и проверки плагиата (уровни 1-2)."""
|
||||
|
||||
import io
|
||||
import logging
|
||||
from datetime import UTC
|
||||
from pathlib import Path
|
||||
from typing import Any
|
||||
|
||||
@@ -253,7 +253,7 @@ def extract_and_check(
|
||||
except Exception as exc:
|
||||
logger.error(f"Ошибка при обработке задачи {task_id!r}: {exc}", exc_info=True)
|
||||
update_task_status(task_id, "failed", str(exc))
|
||||
raise self.retry(exc=exc, countdown=60)
|
||||
raise self.retry(exc=exc, countdown=60) from exc
|
||||
|
||||
|
||||
@celery_app.task(name="index.add_document")
|
||||
@@ -330,6 +330,7 @@ def add_document(doc_data: dict[str, Any], dispatch_embed: bool = True) -> dict[
|
||||
# Индексация в Elasticsearch
|
||||
try:
|
||||
from elasticsearch import Elasticsearch
|
||||
|
||||
from app.config import settings as cfg
|
||||
|
||||
es = Elasticsearch(cfg.ELASTICSEARCH_URL)
|
||||
@@ -409,7 +410,7 @@ def enrich_full_text(self, doc_id: int, url: str) -> dict[str, Any]:
|
||||
)
|
||||
except Exception as exc:
|
||||
logger.error(f"enrich_full_text: не удалось сохранить текст в MinIO для {doc_id}: {exc}")
|
||||
raise self.retry(exc=exc, countdown=120)
|
||||
raise self.retry(exc=exc, countdown=120) from exc
|
||||
|
||||
# Пересчитать fingerprints по полному тексту
|
||||
doc_fp = winnow(text)
|
||||
@@ -501,7 +502,7 @@ def run_parser(source_id: int) -> dict[str, Any]:
|
||||
задачу add_document для каждого полученного документа.
|
||||
"""
|
||||
import sys
|
||||
from datetime import datetime, timezone
|
||||
from datetime import datetime
|
||||
|
||||
from app.models import ParseSource
|
||||
|
||||
@@ -594,7 +595,7 @@ def run_parser(source_id: int) -> dict[str, Any]:
|
||||
src.last_status = "error" if error_msg else "done"
|
||||
src.last_error = error_msg
|
||||
src.docs_added = (src.docs_added or 0) + added
|
||||
src.last_run_at = datetime.now(timezone.utc)
|
||||
src.last_run_at = datetime.now(UTC)
|
||||
session.commit()
|
||||
|
||||
return {"status": "error" if error_msg else "done", "added": added, "error": error_msg}
|
||||
|
||||
Reference in New Issue
Block a user