feat(ingest+поиск): приём ZIP через интерфейс, регистронезависимый поиск, чистка очереди

- Загрузка архива (§4.1): POST /ingest распаковывает ZIP, дораспознаёт и
  догружает прайсы в базу (append). Виджет в админке. Кэш эмбеддингов справочника
  (dict_emb.npy) — догрузка считает только новый файл, эмбеддинги best-effort с
  откатом на fuzzy при сбое Gemini.
- Поиск по name_norm (lowercase): «УЗИ» и «узи» дают одинаковый результат —
  SQLite LIKE не сворачивает регистр для кириллицы.
- Фильтр названий: код-мнемоники («МОЗО.15») больше не попадают в очередь.
- /stats считается из базы — цифры на дашборде обновляются после загрузки.
- Деплой через Dockerfile (зависимости в образе, код монтируется томом).
- ruff: ядро и весь репозиторий проходят проверку.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-06-27 11:35:12 +05:00
parent 89928511ba
commit 69a9884db5
25 changed files with 2217 additions and 182 deletions
+7 -2
View File
@@ -1,4 +1,5 @@
"""Прогон извлечения по всему архиву: сколько позиций берёт каждый формат."""
import sys
from pathlib import Path
@@ -14,11 +15,15 @@ for path in files:
total += len(doc.rows)
tiers = sorted({t for row in doc.rows for t in row.prices})
print(f"\n{'=' * 68}")
print(f"{path.name} [{doc.file_format}] партнёр='{doc.partner_name}' дата={doc.effective_date}")
print(
f"{path.name} [{doc.file_format}] партнёр='{doc.partner_name}' дата={doc.effective_date}"
)
print(f" позиций: {len(doc.rows)} | тарифы: {tiers}")
if doc.parse_log:
print(f" лог: {doc.parse_log[:2]}")
for row in doc.rows[:3]:
print(f" код={row.service_code_source!r} «{row.service_name_raw[:40]}» {row.prices} секц={row.section!r}")
print(
f" код={row.service_code_source!r} «{row.service_name_raw[:40]}» {row.prices} секц={row.section!r}"
)
print(f"\n{'=' * 68}\nИТОГО позиций по архиву: {total}")
+7 -2
View File
@@ -1,4 +1,5 @@
"""Подбор порога нормализации: выборка позиций → каскад → покрытие при порогах."""
import random
import sys
from pathlib import Path
@@ -63,7 +64,9 @@ for thr in (0.58, 0.60, 0.62, 0.64, 0.66, 0.70):
emb_matched = int((top_score >= thr).sum())
fuzzy_matched = int(((fuzzy_score >= 88) & (top_score < thr)).sum())
coverage = base + emb_matched + fuzzy_matched
print(f" порог {thr}: эмб {emb_matched} + fuzzy {fuzzy_matched} → покрытие {100 * coverage / len(sample):.0f}%")
print(
f" порог {thr}: эмб {emb_matched} + fuzzy {fuzzy_matched} → покрытие {100 * coverage / len(sample):.0f}%"
)
print("\nпримеры эмбеддинг-совпадений (порог 0.62):")
shown = 0
@@ -75,5 +78,7 @@ print("примеры unmatched (top<0.62 и fuzzy<88):")
shown = 0
for k, (name, _) in enumerate(pending):
if top_score[k] < 0.62 and fuzzy_score[k] < 88 and shown < 6:
print(f" «{name[:48]}» (лучший {services[int(top_idx[k])].name_ru[:22]} {top_score[k]:.2f})")
print(
f" «{name[:48]}» (лучший {services[int(top_idx[k])].name_ru[:22]} {top_score[k]:.2f})"
)
shown += 1
+15 -7
View File
@@ -4,6 +4,7 @@
точное совпадение + RapidFuzz). Эмбеддинги в боевом каскаде поднимут этот процент —
здесь нужен нижний ориентир, чтобы убедиться, что цель 70% достижима.
"""
import re
import sys
from pathlib import Path
@@ -17,7 +18,9 @@ from rapidfuzz import fuzz, process
from etl.dictionary import load_dictionary, normalize_name
svcs = load_dictionary(REPO / "data/reference/dictionary.xlsx")
print(f"Справочник: {len(svcs)} услуг | с кодом тарификатора: {sum(1 for s in svcs if s.tarificator_code)}")
print(
f"Справочник: {len(svcs)} услуг | с кодом тарификатора: {sum(1 for s in svcs if s.tarificator_code)}"
)
by_code = {s.tarificator_code: s for s in svcs if s.tarificator_code}
by_norm: dict[str, object] = {}
@@ -35,11 +38,11 @@ for row in table.rows:
if len(cells) < 3:
continue
code, name, price = cells[0], cells[1], cells[2]
if code == name == price: # строка-заголовок секции (объединённые ячейки)
if code == name == price: # строка-заголовок секции (объединённые ячейки)
continue
if name.lower() == "наименование услуги":
continue
if not re.search(r"\d", price): # строка без цены — не позиция
if not re.search(r"\d", price): # строка без цены — не позиция
continue
items.append((code, name, price))
@@ -52,14 +55,17 @@ examples_ok, examples_miss = [], []
for code, name, price in items:
nn = normalize_name(name)
if code in by_code:
matched += 1; by_code_n += 1
matched += 1
by_code_n += 1
continue
if nn in by_norm:
matched += 1; by_exact_n += 1
matched += 1
by_exact_n += 1
continue
best = process.extractOne(nn, names_norm, scorer=fuzz.token_set_ratio)
if best and best[1] >= THRESHOLD:
matched += 1; by_fuzzy_n += 1
matched += 1
by_fuzzy_n += 1
if len(examples_ok) < 6:
examples_ok.append((name, svcs[best[2]].name_ru, round(best[1])))
elif len(examples_miss) < 6 and best:
@@ -67,7 +73,9 @@ for code, name, price in items:
pct = 100 * matched / max(1, len(items))
print(f"\nАВТО-СОПОСТАВЛЕНО (без эмбеддингов): {matched}/{len(items)} = {pct:.0f}%")
print(f" код тарификатора: {by_code_n} | точное имя: {by_exact_n} | fuzzy≥{THRESHOLD}: {by_fuzzy_n}")
print(
f" код тарификатора: {by_code_n} | точное имя: {by_exact_n} | fuzzy≥{THRESHOLD}: {by_fuzzy_n}"
)
print("\nпримеры совпадений:")
for raw, canon, sc in examples_ok:
print(f" «{raw[:46]}» → «{canon[:46]}» ({sc})")