Files
medtech-hackathon/etl/extractors/__init__.py
T
admins 1de66eaa85 feat(etl): нормализация на Gemini-эмбеддингах (API), Vision подключён
- эмбеддинги переведены с локального torch на Gemini API (лёгкий контейнер)
  GeminiEmbedder: gemini-embedding-001, 768d, RETRIEVAL query/document
- фильтр настоящих названий: коды/числа не уходят в сопоставление
- порог косинуса 0.70 → ~73% автонормализации (цель ТЗ ≥70%), остальное в unmatched
- Vision (gemini-2.5-flash, новый SDK) подключён в диспетчер для скан/нулевых PDF;
  проверено: Клиника 5 — 34 чистые позиции со страницы
- зависимости: убран torch/sentence-transformers, добавлен google-genai+numpy

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-26 17:17:06 +05:00

73 lines
3.2 KiB
Python

"""Диспетчер извлечения: путь к файлу → ParsedDocument.
Определяет формат, читает файл в сетки и прогоняет их через общий грид-экстрактор.
PDF с битым текстовым слоем помечается как scan_pdf — его добирает путь через Vision.
Любой сбой чтения логируется, но не роняет обработку остального архива.
"""
from __future__ import annotations
import os
import sys
from datetime import date
from pathlib import Path
sys.path.insert(0, str(Path(__file__).resolve().parents[2]))
from contracts.models import ParsedDocument # noqa: E402
from etl.extractors import readers # noqa: E402
from etl.extractors.grid import extract_rows_from_grid # noqa: E402
def extract(path: str) -> ParsedDocument:
"""Разобрать один файл прайса в структурированный ParsedDocument."""
name = Path(path).name
fmt = readers.detect_format(path)
doc = ParsedDocument(file_name=name, file_format=fmt, partner_name=readers.partner_from_name(name))
year = readers.year_from_name(name)
if year:
doc.effective_date = date(year, 1, 1)
try:
if fmt == "xlsx":
grids, text = readers.xlsx_grids(path)
elif fmt == "xls":
grids, text = readers.xls_grids(path)
elif fmt == "docx":
grids, text = readers.docx_grids(path)
elif fmt == "pdf":
grids, text = readers.pdf_grids(path)
if readers.is_garbled(text):
doc.file_format = "scan_pdf"
doc.parse_log.append("битый текстовый слой — требуется распознавание (Vision)")
else:
doc.parse_log.append(f"неизвестный формат: {fmt}")
return doc
except Exception as exc: # noqa: BLE001 — сбой чтения логируем, конвейер не роняем
doc.parse_log.append(f"ошибка чтения: {type(exc).__name__}: {exc}")
return doc
doc.raw_content = text[:200_000]
for grid in grids:
try:
doc.rows.extend(extract_rows_from_grid(grid))
except Exception as exc: # noqa: BLE001
doc.parse_log.append(f"ошибка разбора таблицы: {type(exc).__name__}: {exc}")
# Трудные PDF (скан, битый слой, нулевой разбор) добираем через Gemini Vision.
needs_vision = fmt == "pdf" and (doc.file_format == "scan_pdf" or not doc.rows)
if needs_vision and os.environ.get("GEMINI_API_KEY"):
try:
from etl.extractors.vision import extract_with_vision
vision_rows = extract_with_vision(path)
doc.rows.extend(vision_rows)
doc.file_format = "scan_pdf"
doc.parse_log.append(f"Vision добрал {len(vision_rows)} позиций")
except Exception as exc: # noqa: BLE001
doc.parse_log.append(f"Vision не сработал: {type(exc).__name__}: {exc}")
if not doc.rows:
doc.parse_log.append("позиции не извлечены")
return doc