feat(etl): нормализация на Gemini-эмбеддингах (API), Vision подключён
- эмбеддинги переведены с локального torch на Gemini API (лёгкий контейнер) GeminiEmbedder: gemini-embedding-001, 768d, RETRIEVAL query/document - фильтр настоящих названий: коды/числа не уходят в сопоставление - порог косинуса 0.70 → ~73% автонормализации (цель ТЗ ≥70%), остальное в unmatched - Vision (gemini-2.5-flash, новый SDK) подключён в диспетчер для скан/нулевых PDF; проверено: Клиника 5 — 34 чистые позиции со страницы - зависимости: убран torch/sentence-transformers, добавлен google-genai+numpy Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -1,59 +0,0 @@
|
||||
"""Замер автонормализации: извлечь весь архив, сопоставить со справочником, дать %."""
|
||||
import sys
|
||||
from collections import Counter
|
||||
from pathlib import Path
|
||||
|
||||
REPO = Path(__file__).resolve().parents[2]
|
||||
sys.path.insert(0, str(REPO))
|
||||
|
||||
from sentence_transformers import SentenceTransformer
|
||||
|
||||
from etl.dictionary import load_dictionary
|
||||
from etl.extractors import extract
|
||||
from etl.normalize import Matcher
|
||||
|
||||
# --- собрать все извлечённые позиции ---
|
||||
rows: list[tuple[str, str | None]] = []
|
||||
for path in sorted((REPO / "data/raw").glob("*")):
|
||||
for row in extract(str(path)).rows:
|
||||
rows.append((row.service_name_raw, row.service_code_source))
|
||||
print(f"позиций всего: {len(rows)}")
|
||||
|
||||
# дедуп по (имя, код) — одинаковые строки сопоставляем один раз
|
||||
occurrences: Counter[tuple[str, str | None]] = Counter(rows)
|
||||
keys = list(occurrences)
|
||||
print(f"уникальных (имя, код): {len(keys)}")
|
||||
|
||||
services = load_dictionary(REPO / "data/reference/dictionary.xlsx")
|
||||
print("загружаю модель эмбеддингов (первый раз — скачивание)…")
|
||||
embedder = SentenceTransformer("paraphrase-multilingual-MiniLM-L12-v2")
|
||||
matcher = Matcher(services, embedder=embedder)
|
||||
|
||||
print("сопоставляю…")
|
||||
results = matcher.match_batch([k[0] for k in keys], [k[1] for k in keys])
|
||||
|
||||
by_method: Counter[str | None] = Counter()
|
||||
total = matched = 0
|
||||
samples: dict[str | None, list] = {}
|
||||
canon_by_id = {s.service_id: s.name_ru for s in services}
|
||||
for key, res in zip(keys, results, strict=True):
|
||||
count = occurrences[key]
|
||||
total += count
|
||||
by_method[res.method] += count
|
||||
if res.service_id:
|
||||
matched += count
|
||||
bucket = samples.setdefault(res.method, [])
|
||||
if len(bucket) < 5:
|
||||
bucket.append((key[0], canon_by_id.get(res.service_id, "—"), round(res.confidence, 2)))
|
||||
|
||||
print(f"\nАВТОНОРМАЛИЗАЦИЯ: {matched}/{total} = {100 * matched / total:.0f}% (цель ТЗ ≥70%)")
|
||||
for method in ("code", "exact", "embedding", "fuzzy", None):
|
||||
print(f" {method or 'unmatched':10}: {by_method[method]} строк")
|
||||
|
||||
print("\nпримеры сопоставлений:")
|
||||
for method in ("code", "exact", "embedding", "fuzzy"):
|
||||
for raw, canon, score in samples.get(method, [])[:3]:
|
||||
print(f" [{method:9}] «{raw[:36]}» → «{canon[:36]}» ({score})")
|
||||
print("\nпримеры unmatched:")
|
||||
for raw, _canon, _score in samples.get(None, [])[:6]:
|
||||
print(f" «{raw[:52]}»")
|
||||
@@ -0,0 +1,79 @@
|
||||
"""Подбор порога нормализации: выборка позиций → каскад → покрытие при порогах."""
|
||||
import random
|
||||
import sys
|
||||
from pathlib import Path
|
||||
|
||||
import numpy as np
|
||||
|
||||
REPO = Path(__file__).resolve().parents[2]
|
||||
sys.path.insert(0, str(REPO))
|
||||
|
||||
from rapidfuzz import fuzz, process
|
||||
|
||||
from etl.dictionary import load_dictionary, normalize_name
|
||||
from etl.extractors import extract
|
||||
from etl.normalize.embedding import GeminiEmbedder
|
||||
from etl.normalize.matcher import _CODE_CORE_RE
|
||||
|
||||
rows = []
|
||||
for path in sorted((REPO / "data/raw").glob("*")):
|
||||
for row in extract(str(path)).rows:
|
||||
rows.append((row.service_name_raw, row.service_code_source))
|
||||
random.seed(0)
|
||||
sample = random.sample(rows, min(2000, len(rows)))
|
||||
print(f"всего {len(rows)}, выборка {len(sample)}")
|
||||
|
||||
services = load_dictionary(REPO / "data/reference/dictionary.xlsx")
|
||||
by_code = {s.tarificator_code: s for s in services if s.tarificator_code}
|
||||
by_norm: dict[str, object] = {}
|
||||
for s in services:
|
||||
by_norm.setdefault(s.name_norm, s)
|
||||
names_norm = [s.name_norm for s in services]
|
||||
|
||||
embedder = GeminiEmbedder()
|
||||
print("эмбеддинг справочника (1281)…")
|
||||
dict_emb = embedder.encode([s.name_ru for s in services], task_type="RETRIEVAL_DOCUMENT")
|
||||
|
||||
code_n = exact_n = 0
|
||||
pending: list[tuple[str, str]] = []
|
||||
for name, code in sample:
|
||||
m = _CODE_CORE_RE.search(code) if code else None
|
||||
if m and m.group(0) in by_code:
|
||||
code_n += 1
|
||||
continue
|
||||
norm = normalize_name(name)
|
||||
if norm in by_norm:
|
||||
exact_n += 1
|
||||
continue
|
||||
pending.append((name, norm))
|
||||
|
||||
print(f"код: {code_n} | точное: {exact_n} | дальше эмбеддинги/fuzzy: {len(pending)}")
|
||||
print("эмбеддинг запросов…")
|
||||
query_emb = embedder.encode([p[0] for p in pending], task_type="RETRIEVAL_QUERY")
|
||||
sims = query_emb @ dict_emb.T
|
||||
top_idx = sims.argmax(axis=1)
|
||||
top_score = sims.max(axis=1)
|
||||
fuzzy_score = np.array(
|
||||
[process.extractOne(nn, names_norm, scorer=fuzz.token_set_ratio)[1] for _, nn in pending]
|
||||
)
|
||||
|
||||
base = code_n + exact_n
|
||||
print(f"\nБаза (код+точное): {base}/{len(sample)} = {100 * base / len(sample):.0f}%")
|
||||
for thr in (0.58, 0.60, 0.62, 0.64, 0.66, 0.70):
|
||||
emb_matched = int((top_score >= thr).sum())
|
||||
fuzzy_matched = int(((fuzzy_score >= 88) & (top_score < thr)).sum())
|
||||
coverage = base + emb_matched + fuzzy_matched
|
||||
print(f" порог {thr}: эмб {emb_matched} + fuzzy {fuzzy_matched} → покрытие {100 * coverage / len(sample):.0f}%")
|
||||
|
||||
print("\nпримеры эмбеддинг-совпадений (порог 0.62):")
|
||||
shown = 0
|
||||
for k, (name, _) in enumerate(pending):
|
||||
if top_score[k] >= 0.62 and shown < 7:
|
||||
print(f" «{name[:34]}» → «{services[int(top_idx[k])].name_ru[:34]}» ({top_score[k]:.2f})")
|
||||
shown += 1
|
||||
print("примеры unmatched (top<0.62 и fuzzy<88):")
|
||||
shown = 0
|
||||
for k, (name, _) in enumerate(pending):
|
||||
if top_score[k] < 0.62 and fuzzy_score[k] < 88 and shown < 6:
|
||||
print(f" «{name[:48]}» (лучший {services[int(top_idx[k])].name_ru[:22]} {top_score[k]:.2f})")
|
||||
shown += 1
|
||||
Reference in New Issue
Block a user