feat(ingest+поиск): приём ZIP через интерфейс, регистронезависимый поиск, чистка очереди
- Загрузка архива (§4.1): POST /ingest распаковывает ZIP, дораспознаёт и догружает прайсы в базу (append). Виджет в админке. Кэш эмбеддингов справочника (dict_emb.npy) — догрузка считает только новый файл, эмбеддинги best-effort с откатом на fuzzy при сбое Gemini. - Поиск по name_norm (lowercase): «УЗИ» и «узи» дают одинаковый результат — SQLite LIKE не сворачивает регистр для кириллицы. - Фильтр названий: код-мнемоники («МОЗО.15») больше не попадают в очередь. - /stats считается из базы — цифры на дашборде обновляются после загрузки. - Деплой через Dockerfile (зависимости в образе, код монтируется томом). - ruff: ядро и весь репозиторий проходят проверку. Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -4,6 +4,7 @@
|
||||
точное совпадение + RapidFuzz). Эмбеддинги в боевом каскаде поднимут этот процент —
|
||||
здесь нужен нижний ориентир, чтобы убедиться, что цель 70% достижима.
|
||||
"""
|
||||
|
||||
import re
|
||||
import sys
|
||||
from pathlib import Path
|
||||
@@ -17,7 +18,9 @@ from rapidfuzz import fuzz, process
|
||||
from etl.dictionary import load_dictionary, normalize_name
|
||||
|
||||
svcs = load_dictionary(REPO / "data/reference/dictionary.xlsx")
|
||||
print(f"Справочник: {len(svcs)} услуг | с кодом тарификатора: {sum(1 for s in svcs if s.tarificator_code)}")
|
||||
print(
|
||||
f"Справочник: {len(svcs)} услуг | с кодом тарификатора: {sum(1 for s in svcs if s.tarificator_code)}"
|
||||
)
|
||||
|
||||
by_code = {s.tarificator_code: s for s in svcs if s.tarificator_code}
|
||||
by_norm: dict[str, object] = {}
|
||||
@@ -35,11 +38,11 @@ for row in table.rows:
|
||||
if len(cells) < 3:
|
||||
continue
|
||||
code, name, price = cells[0], cells[1], cells[2]
|
||||
if code == name == price: # строка-заголовок секции (объединённые ячейки)
|
||||
if code == name == price: # строка-заголовок секции (объединённые ячейки)
|
||||
continue
|
||||
if name.lower() == "наименование услуги":
|
||||
continue
|
||||
if not re.search(r"\d", price): # строка без цены — не позиция
|
||||
if not re.search(r"\d", price): # строка без цены — не позиция
|
||||
continue
|
||||
items.append((code, name, price))
|
||||
|
||||
@@ -52,14 +55,17 @@ examples_ok, examples_miss = [], []
|
||||
for code, name, price in items:
|
||||
nn = normalize_name(name)
|
||||
if code in by_code:
|
||||
matched += 1; by_code_n += 1
|
||||
matched += 1
|
||||
by_code_n += 1
|
||||
continue
|
||||
if nn in by_norm:
|
||||
matched += 1; by_exact_n += 1
|
||||
matched += 1
|
||||
by_exact_n += 1
|
||||
continue
|
||||
best = process.extractOne(nn, names_norm, scorer=fuzz.token_set_ratio)
|
||||
if best and best[1] >= THRESHOLD:
|
||||
matched += 1; by_fuzzy_n += 1
|
||||
matched += 1
|
||||
by_fuzzy_n += 1
|
||||
if len(examples_ok) < 6:
|
||||
examples_ok.append((name, svcs[best[2]].name_ru, round(best[1])))
|
||||
elif len(examples_miss) < 6 and best:
|
||||
@@ -67,7 +73,9 @@ for code, name, price in items:
|
||||
|
||||
pct = 100 * matched / max(1, len(items))
|
||||
print(f"\nАВТО-СОПОСТАВЛЕНО (без эмбеддингов): {matched}/{len(items)} = {pct:.0f}%")
|
||||
print(f" код тарификатора: {by_code_n} | точное имя: {by_exact_n} | fuzzy≥{THRESHOLD}: {by_fuzzy_n}")
|
||||
print(
|
||||
f" код тарификатора: {by_code_n} | точное имя: {by_exact_n} | fuzzy≥{THRESHOLD}: {by_fuzzy_n}"
|
||||
)
|
||||
print("\nпримеры совпадений:")
|
||||
for raw, canon, sc in examples_ok:
|
||||
print(f" «{raw[:46]}» → «{canon[:46]}» ({sc})")
|
||||
|
||||
Reference in New Issue
Block a user