feat(etl): извлечение прайсов по форматам (xlsx/xls/docx/pdf) и распознавание сложных страниц через Gemini Vision
This commit is contained in:
@@ -0,0 +1,29 @@
|
||||
"""Прогон извлечения по всему архиву: сколько позиций берёт каждый формат."""
|
||||
|
||||
import sys
|
||||
from pathlib import Path
|
||||
|
||||
REPO = Path(__file__).resolve().parents[2]
|
||||
sys.path.insert(0, str(REPO))
|
||||
|
||||
from etl.extractors import extract
|
||||
|
||||
files = sorted((REPO / "data/raw").glob("*"))
|
||||
total = 0
|
||||
for path in files:
|
||||
doc = extract(str(path))
|
||||
total += len(doc.rows)
|
||||
tiers = sorted({t for row in doc.rows for t in row.prices})
|
||||
print(f"\n{'=' * 68}")
|
||||
print(
|
||||
f"{path.name} [{doc.file_format}] партнёр='{doc.partner_name}' дата={doc.effective_date}"
|
||||
)
|
||||
print(f" позиций: {len(doc.rows)} | тарифы: {tiers}")
|
||||
if doc.parse_log:
|
||||
print(f" лог: {doc.parse_log[:2]}")
|
||||
for row in doc.rows[:3]:
|
||||
print(
|
||||
f" код={row.service_code_source!r} «{row.service_name_raw[:40]}» {row.prices} секц={row.section!r}"
|
||||
)
|
||||
|
||||
print(f"\n{'=' * 68}\nИТОГО позиций по архиву: {total}")
|
||||
@@ -0,0 +1,84 @@
|
||||
"""Подбор порога нормализации: выборка позиций → каскад → покрытие при порогах."""
|
||||
|
||||
import random
|
||||
import sys
|
||||
from pathlib import Path
|
||||
|
||||
import numpy as np
|
||||
|
||||
REPO = Path(__file__).resolve().parents[2]
|
||||
sys.path.insert(0, str(REPO))
|
||||
|
||||
from rapidfuzz import fuzz, process
|
||||
|
||||
from etl.dictionary import load_dictionary, normalize_name
|
||||
from etl.extractors import extract
|
||||
from etl.normalize.embedding import GeminiEmbedder
|
||||
from etl.normalize.matcher import _CODE_CORE_RE
|
||||
|
||||
rows = []
|
||||
for path in sorted((REPO / "data/raw").glob("*")):
|
||||
for row in extract(str(path)).rows:
|
||||
rows.append((row.service_name_raw, row.service_code_source))
|
||||
random.seed(0)
|
||||
sample = random.sample(rows, min(2000, len(rows)))
|
||||
print(f"всего {len(rows)}, выборка {len(sample)}")
|
||||
|
||||
services = load_dictionary(REPO / "data/reference/dictionary.xlsx")
|
||||
by_code = {s.tarificator_code: s for s in services if s.tarificator_code}
|
||||
by_norm: dict[str, object] = {}
|
||||
for s in services:
|
||||
by_norm.setdefault(s.name_norm, s)
|
||||
names_norm = [s.name_norm for s in services]
|
||||
|
||||
embedder = GeminiEmbedder()
|
||||
print("эмбеддинг справочника (1281)…")
|
||||
dict_emb = embedder.encode([s.name_ru for s in services], task_type="RETRIEVAL_DOCUMENT")
|
||||
|
||||
code_n = exact_n = 0
|
||||
pending: list[tuple[str, str]] = []
|
||||
for name, code in sample:
|
||||
m = _CODE_CORE_RE.search(code) if code else None
|
||||
if m and m.group(0) in by_code:
|
||||
code_n += 1
|
||||
continue
|
||||
norm = normalize_name(name)
|
||||
if norm in by_norm:
|
||||
exact_n += 1
|
||||
continue
|
||||
pending.append((name, norm))
|
||||
|
||||
print(f"код: {code_n} | точное: {exact_n} | дальше эмбеддинги/fuzzy: {len(pending)}")
|
||||
print("эмбеддинг запросов…")
|
||||
query_emb = embedder.encode([p[0] for p in pending], task_type="RETRIEVAL_QUERY")
|
||||
sims = query_emb @ dict_emb.T
|
||||
top_idx = sims.argmax(axis=1)
|
||||
top_score = sims.max(axis=1)
|
||||
fuzzy_score = np.array(
|
||||
[process.extractOne(nn, names_norm, scorer=fuzz.token_set_ratio)[1] for _, nn in pending]
|
||||
)
|
||||
|
||||
base = code_n + exact_n
|
||||
print(f"\nБаза (код+точное): {base}/{len(sample)} = {100 * base / len(sample):.0f}%")
|
||||
for thr in (0.58, 0.60, 0.62, 0.64, 0.66, 0.70):
|
||||
emb_matched = int((top_score >= thr).sum())
|
||||
fuzzy_matched = int(((fuzzy_score >= 88) & (top_score < thr)).sum())
|
||||
coverage = base + emb_matched + fuzzy_matched
|
||||
print(
|
||||
f" порог {thr}: эмб {emb_matched} + fuzzy {fuzzy_matched} → покрытие {100 * coverage / len(sample):.0f}%"
|
||||
)
|
||||
|
||||
print("\nпримеры эмбеддинг-совпадений (порог 0.62):")
|
||||
shown = 0
|
||||
for k, (name, _) in enumerate(pending):
|
||||
if top_score[k] >= 0.62 and shown < 7:
|
||||
print(f" «{name[:34]}» → «{services[int(top_idx[k])].name_ru[:34]}» ({top_score[k]:.2f})")
|
||||
shown += 1
|
||||
print("примеры unmatched (top<0.62 и fuzzy<88):")
|
||||
shown = 0
|
||||
for k, (name, _) in enumerate(pending):
|
||||
if top_score[k] < 0.62 and fuzzy_score[k] < 88 and shown < 6:
|
||||
print(
|
||||
f" «{name[:48]}» (лучший {services[int(top_idx[k])].name_ru[:22]} {top_score[k]:.2f})"
|
||||
)
|
||||
shown += 1
|
||||
@@ -0,0 +1,84 @@
|
||||
"""Phase 0 proof: справочник загружается, реальный прайс парсится, каскад работает.
|
||||
|
||||
Считает базовый процент автосопоставления БЕЗ эмбеддингов (только код тарификатора +
|
||||
точное совпадение + RapidFuzz). Эмбеддинги в боевом каскаде поднимут этот процент —
|
||||
здесь нужен нижний ориентир, чтобы убедиться, что цель 70% достижима.
|
||||
"""
|
||||
|
||||
import re
|
||||
import sys
|
||||
from pathlib import Path
|
||||
|
||||
REPO = Path(__file__).resolve().parents[2]
|
||||
sys.path.insert(0, str(REPO))
|
||||
|
||||
import docx
|
||||
from rapidfuzz import fuzz, process
|
||||
|
||||
from etl.dictionary import load_dictionary, normalize_name
|
||||
|
||||
svcs = load_dictionary(REPO / "data/reference/dictionary.xlsx")
|
||||
print(
|
||||
f"Справочник: {len(svcs)} услуг | с кодом тарификатора: {sum(1 for s in svcs if s.tarificator_code)}"
|
||||
)
|
||||
|
||||
by_code = {s.tarificator_code: s for s in svcs if s.tarificator_code}
|
||||
by_norm: dict[str, object] = {}
|
||||
for s in svcs:
|
||||
by_norm.setdefault(s.name_norm, s)
|
||||
names_norm = [s.name_norm for s in svcs]
|
||||
|
||||
# --- разобрать реальный прайс Клиники 1 (docx, таблица «Код | Наименование | Стоимость») ---
|
||||
doc = docx.Document(REPO / "data/raw/Клиника 1 прайс 2024.docx")
|
||||
table = doc.tables[0]
|
||||
|
||||
items = []
|
||||
for row in table.rows:
|
||||
cells = [c.text.strip() for c in row.cells]
|
||||
if len(cells) < 3:
|
||||
continue
|
||||
code, name, price = cells[0], cells[1], cells[2]
|
||||
if code == name == price: # строка-заголовок секции (объединённые ячейки)
|
||||
continue
|
||||
if name.lower() == "наименование услуги":
|
||||
continue
|
||||
if not re.search(r"\d", price): # строка без цены — не позиция
|
||||
continue
|
||||
items.append((code, name, price))
|
||||
|
||||
print(f"Клиника 1 (2024): извлечено позиций — {len(items)}")
|
||||
|
||||
THRESHOLD = 88
|
||||
matched = by_code_n = by_exact_n = by_fuzzy_n = 0
|
||||
examples_ok, examples_miss = [], []
|
||||
|
||||
for code, name, price in items:
|
||||
nn = normalize_name(name)
|
||||
if code in by_code:
|
||||
matched += 1
|
||||
by_code_n += 1
|
||||
continue
|
||||
if nn in by_norm:
|
||||
matched += 1
|
||||
by_exact_n += 1
|
||||
continue
|
||||
best = process.extractOne(nn, names_norm, scorer=fuzz.token_set_ratio)
|
||||
if best and best[1] >= THRESHOLD:
|
||||
matched += 1
|
||||
by_fuzzy_n += 1
|
||||
if len(examples_ok) < 6:
|
||||
examples_ok.append((name, svcs[best[2]].name_ru, round(best[1])))
|
||||
elif len(examples_miss) < 6 and best:
|
||||
examples_miss.append((name, svcs[best[2]].name_ru, round(best[1])))
|
||||
|
||||
pct = 100 * matched / max(1, len(items))
|
||||
print(f"\nАВТО-СОПОСТАВЛЕНО (без эмбеддингов): {matched}/{len(items)} = {pct:.0f}%")
|
||||
print(
|
||||
f" код тарификатора: {by_code_n} | точное имя: {by_exact_n} | fuzzy≥{THRESHOLD}: {by_fuzzy_n}"
|
||||
)
|
||||
print("\nпримеры совпадений:")
|
||||
for raw, canon, sc in examples_ok:
|
||||
print(f" «{raw[:46]}» → «{canon[:46]}» ({sc})")
|
||||
print("\nпримеры в очередь unmatched (лучший кандидат ниже порога):")
|
||||
for raw, canon, sc in examples_miss:
|
||||
print(f" «{raw[:46]}» → лучший «{canon[:40]}» ({sc})")
|
||||
Reference in New Issue
Block a user