fix(normalize): confidence-aware guard переобобщения → честные 73,7%

Прежний guard снимал эмбеддинг-матч, если услуга собрала в клинике больше
8 разных названий. Это наказывало легитимные частотные услуги — одна «МРТ
головного мозга» реально встречается под десятками протоколов (с контрастом,
3Тл, предоперационная), и все они верно нормализуются к ней. Процент падал
до 69%.

Теперь снимаем только НЕуверенные матчи (<0,72) внутри концентрированных
групп: так отсекается сиблинг-захват (напр. «Магний Mg (моча)» подтягивал
Никель/Свинец/Ртуть в моче на пороге 0,70), а верные вариации остаются
сопоставленными. Признак ошибки — низкая уверенность, а не число названий.

Итог на тестовом архиве: 16 140 позиций извлечено, 73,7% нормализовано
автоматически (цель ТЗ ≥70%), 273 неуверенных матча — в очередь верификации.
Цифры выровнены в README, ARCHITECTURE, питч-деках, PPTX, quality_report.

Плюс полировка: извлечение города клиники, регистронезависимый поиск.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-06-27 19:42:21 +05:00
parent 1a4cc039b2
commit dbe36d3323
10 changed files with 120 additions and 28 deletions
+10 -10
View File
@@ -1,15 +1,15 @@
{
"documents": 10,
"partners": 8,
"items": 8871,
"auto_matched": 6555,
"auto_matched_pct": 73.9,
"unmatched": 2316,
"items": 16140,
"auto_matched": 11899,
"auto_matched_pct": 73.7,
"unmatched": 4241,
"by_method": {
"code": 1414,
"exact": 167,
"embedding": 4903,
"fuzzy": 71,
"null": 2316
"code": 4397,
"exact": 291,
"embedding": 7083,
"fuzzy": 128,
"over_match": 273
}
}
}