feat(ingest): is_oa-фильтр OpenAlex + PDF-ссылка arXiv → покрытие full-text ↑
Some checks failed
Deploy / deploy (push) Failing after 4m37s
Some checks failed
Deploy / deploy (push) Failing after 4m37s
Корпус набивался с ~8% полного текста — по широким темам мало доступных PDF. - OpenAlex: параметр open_access_only (is_oa:true), включён по умолчанию для заливки (INGEST_OPEN_ACCESS_ONLY). A/B: покрытие 20% → 45%. - arXiv: url теперь прямая ссылка на PDF (был на HTML-страницу аннотации), теперь enrich_full_text реально качает текст (у arXiv PDF почти у 100%). Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -159,12 +159,18 @@ class ArxivParser(BaseParser):
|
||||
doi = link.get("href", "").replace("http://dx.doi.org/", "")
|
||||
break
|
||||
|
||||
# URL
|
||||
# URL — предпочитаем прямую ссылку на PDF (её качает enrich_full_text),
|
||||
# иначе HTML-страницу аннотации
|
||||
url = None
|
||||
for link in entry.findall("atom:link", NS):
|
||||
if link.get("type") == "text/html":
|
||||
if link.get("title") == "pdf" or link.get("type") == "application/pdf":
|
||||
url = link.get("href")
|
||||
break
|
||||
if not url:
|
||||
for link in entry.findall("atom:link", NS):
|
||||
if link.get("type") == "text/html":
|
||||
url = link.get("href")
|
||||
break
|
||||
|
||||
# Категории
|
||||
categories = [
|
||||
|
||||
Reference in New Issue
Block a user