feat(извлечение): надёжное распознавание колонки названий + добор трудных PDF через Vision

- grid: колонки «Код …» и «№» исключены из кандидатов на колонку названий
  (ключ «услуг» ловил «Код услуги») — клиника с 5181 строкой больше не даёт 0.
- vision: авто-добор PDF при пустом или подозрительно низком выходе строк/страницу,
  замена недобора полным распознаванием, ретраи на лимиты, лимит размера документа.
- презентация статуса проекта на /day2; маршрут /day2 в Caddy.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-06-27 12:39:55 +05:00
parent 7d339dce87
commit ac9f7fea15
6 changed files with 255 additions and 21 deletions
+31 -11
View File
@@ -18,6 +18,11 @@ from contracts.models import ParsedDocument # noqa: E402
from etl.extractors import readers # noqa: E402
from etl.extractors.grid import extract_rows_from_grid # noqa: E402
# Порог «подозрительно мало строк на страницу» — ниже него PDF добираем через Vision.
_VISION_MIN_ROWS_PER_PAGE = 12
# Документы крупнее не отправляем в Vision (экономия времени и квоты).
_VISION_MAX_PAGES = 40
def extract(path: str, use_vision: bool = True) -> ParsedDocument:
"""Разобрать один файл прайса в структурированный ParsedDocument.
@@ -61,18 +66,33 @@ def extract(path: str, use_vision: bool = True) -> ParsedDocument:
except Exception as exc: # noqa: BLE001
doc.parse_log.append(f"ошибка разбора таблицы: {type(exc).__name__}: {exc}")
# Трудные PDF (скан, битый слой, нулевой разбор) добираем через Gemini Vision.
needs_vision = use_vision and fmt == "pdf" and (doc.file_format == "scan_pdf" or not doc.rows)
if needs_vision and os.environ.get("GEMINI_API_KEY"):
try:
from etl.extractors.vision import extract_with_vision
# Трудные PDF добираем через Gemini Vision: скан, битый слой, нулевой или
# подозрительно низкий выход строк (мисматч колонок на испорченной вёрстке).
# Большие документы пропускаем ради экономии — это фиксируется в логе, не молча.
if use_vision and fmt == "pdf" and os.environ.get("GEMINI_API_KEY"):
pages = readers.pdf_page_count(path)
low_yield = pages > 0 and len(doc.rows) < pages * _VISION_MIN_ROWS_PER_PAGE
if doc.file_format == "scan_pdf" or not doc.rows or low_yield:
if pages > _VISION_MAX_PAGES:
doc.parse_log.append(
f"Vision пропущен: {pages} стр. больше лимита {_VISION_MAX_PAGES}"
)
else:
try:
from etl.extractors.vision import extract_with_vision
vision_rows = extract_with_vision(path)
doc.rows.extend(vision_rows)
doc.file_format = "scan_pdf"
doc.parse_log.append(f"Vision добрал {len(vision_rows)} позиций")
except Exception as exc: # noqa: BLE001
doc.parse_log.append(f"Vision не сработал: {type(exc).__name__}: {exc}")
vision_rows = extract_with_vision(path, max_pages=_VISION_MAX_PAGES)
if len(vision_rows) > len(doc.rows):
# Vision полнее нативного разбора — заменяем, а не дублируем.
doc.rows = vision_rows
doc.file_format = "scan_pdf"
doc.parse_log.append(f"Vision: {len(vision_rows)} позиций (заменил разбор)")
else:
doc.parse_log.append(
f"Vision: {len(vision_rows)} позиций — разбор не хуже, оставлен"
)
except Exception as exc: # noqa: BLE001
doc.parse_log.append(f"Vision не сработал: {type(exc).__name__}: {exc}")
if not doc.rows:
doc.parse_log.append("позиции не извлечены")