From 45368c64bf1cb11f124bdb8ac4118cfcfda4c091 Mon Sep 17 00:00:00 2001 From: jze9 Date: Wed, 17 Jun 2026 18:47:13 +0500 Subject: [PATCH] =?UTF-8?q?fix:=20VK-=D0=B8=D0=BC=D0=BF=D0=BE=D1=80=D1=82?= =?UTF-8?q?=20=D0=B1=D0=B5=D0=B7=20=D1=84=D0=B8=D0=BB=D1=8C=D1=82=D1=80?= =?UTF-8?q?=D0=B0=20=D0=B4=D0=BE=D0=B1=D0=B8=D1=80=D0=B0=D0=B5=D1=82=20?= =?UTF-8?q?=D0=B2=D1=81=D1=8E=20=D0=B8=D1=81=D1=82=D0=BE=D1=80=D0=B8=D1=8E?= =?UTF-8?q?=20=D0=B2=20=D1=84=D0=BE=D0=BD=D0=B5?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit run_import останавливал группу по batch_new==0, из-за чего для групп без строгого фильтра (strict_filter=False) фоновый импорт обрывался на первом батче без новых записей и не доходил до более старых нетегированных постов. _process_post теперь возвращает статус imported|exists|skipped, а условие остановки ветвится: строгий фильтр — прежнее поведение, без фильтра — стоп только когда весь батч уже в БД. Заодно run_history_import передаёт screen_name для корректных source_url. Co-Authored-By: Claude Opus 4.8 --- api/vk_parser.py | 38 +++++++++++++++++++++++++++----------- 1 file changed, 27 insertions(+), 11 deletions(-) diff --git a/api/vk_parser.py b/api/vk_parser.py index 04f40d4..609c239 100644 --- a/api/vk_parser.py +++ b/api/vk_parser.py @@ -388,13 +388,17 @@ async def _get_or_create_tag(name: str, db: AsyncSession) -> Tag: # ── Post processing ─────────────────────────────────────────────────────────── -async def _process_post(post: dict, category_name: str, db: AsyncSession, strict_filter: bool = True, screen_name: str | None = None) -> bool: +async def _process_post(post: dict, category_name: str, db: AsyncSession, strict_filter: bool = True, screen_name: str | None = None) -> str: + """Обрабатывает один VK-пост. Возвращает статус: + "imported" — пост сохранён; "exists" — уже есть в БД (догнали историю); + "skipped" — пропущен по другой причине (репост известной группы / фильтр / пустой). + """ owner_id = post["owner_id"] post_id = post["id"] vk_slug = _vk_slug(owner_id, post_id) if await _vk_post_exists(owner_id, post_id, db): - return False + return "exists" text = post.get("text", "") attachments = post.get("attachments", []) @@ -410,7 +414,7 @@ async def _process_post(post: dict, category_name: str, db: AsyncSession, strict )).scalar_one_or_none() if in_db: # Оригинал придёт сам из своей группы — пропускаем - return False + return "skipped" # Берём содержимое оригинала; комментарий репостера добавляем в начало orig_text = original.get("text", "") orig_atts = original.get("attachments", []) @@ -421,7 +425,7 @@ async def _process_post(post: dict, category_name: str, db: AsyncSession, strict # strict_filter=True: пропускаем пост если нет тегов # strict_filter=False: импортируем всё, теги назначаем если найдены if strict_filter and not tag_names: - return False + return "skipped" # Заранее генерируем UUID и slug — используются в путях MinIO article_id = uuid.uuid4() @@ -545,7 +549,7 @@ async def _process_post(post: dict, category_name: str, db: AsyncSession, strict content = _sanitize("\n".join(content_parts)) if not content.strip(): - return False + return "skipped" title = _early_title title_slug = _early_slug @@ -594,7 +598,7 @@ async def _process_post(post: dict, category_name: str, db: AsyncSession, strict .values(article_id=article_id) ) await db.commit() - return True + return "imported" # ── VK API fetch ────────────────────────────────────────────────────────────── @@ -674,13 +678,16 @@ async def run_import() -> dict: break batch_new = 0 + batch_existing = 0 for post in posts: try: - ok = await _process_post(post, source.group_name, db, source.strict_filter, screen_name=source.screen_name) - if ok: + st = await _process_post(post, source.group_name, db, source.strict_filter, screen_name=source.screen_name) + if st == "imported": imported += 1; grp_new += 1; batch_new += 1 else: skipped += 1; grp_skip += 1 + if st == "exists": + batch_existing += 1 except Exception as exc: print(f"[VK] ✗ Пост {post.get('id')}: {exc}") errors += 1; grp_err += 1 @@ -691,7 +698,16 @@ async def run_import() -> dict: await asyncio.sleep(1.5) - if batch_new == 0 or len(posts) < batch or not VK_TOKEN: + # Условие остановки: + # — строгий фильтр: новых тегированных постов в батче нет → догнали. + # — без фильтра: останавливаемся только когда ВЕСЬ батч уже в БД, + # иначе пропустили бы более старые нетегированные посты (ранняя остановка). + if source.strict_filter: + caught_up = batch_new == 0 + else: + caught_up = batch_existing == len(posts) + + if caught_up or len(posts) < batch or not VK_TOKEN: print(f"[VK] Догнали до уже импортированных, останавливаем группу") break @@ -749,8 +765,8 @@ async def run_history_import(group_id: str | None = None, since_days: int = 365) hit_cutoff = True continue try: - ok = await _process_post(post, source.group_name, db, source.strict_filter) - if ok: + st = await _process_post(post, source.group_name, db, source.strict_filter, screen_name=source.screen_name) + if st == "imported": imported += 1; grp_new += 1; batch_new += 1 else: skipped += 1; grp_skip += 1