1de66eaa85
- эмбеддинги переведены с локального torch на Gemini API (лёгкий контейнер) GeminiEmbedder: gemini-embedding-001, 768d, RETRIEVAL query/document - фильтр настоящих названий: коды/числа не уходят в сопоставление - порог косинуса 0.70 → ~73% автонормализации (цель ТЗ ≥70%), остальное в unmatched - Vision (gemini-2.5-flash, новый SDK) подключён в диспетчер для скан/нулевых PDF; проверено: Клиника 5 — 34 чистые позиции со страницы - зависимости: убран torch/sentence-transformers, добавлен google-genai+numpy Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
60 lines
2.4 KiB
Python
60 lines
2.4 KiB
Python
"""Эмбеддинги через Gemini API (SDK google-genai) — без локального torch.
|
||
|
||
Лёгкая зависимость вместо sentence-transformers: контейнер на маленьком VPS не
|
||
раздувается и не держит модель в RAM. Размерность 768 выбрана, чтобы вектор лез в
|
||
HNSW-индекс pgvector. Требуется переменная окружения GEMINI_API_KEY.
|
||
"""
|
||
from __future__ import annotations
|
||
|
||
import os
|
||
|
||
import numpy as np
|
||
|
||
EMBED_DIM = 768
|
||
|
||
|
||
class GeminiEmbedder:
|
||
"""Обёртка над Gemini-эмбеддингами с интерфейсом `.encode()` (как у sentence-transformers)."""
|
||
|
||
def __init__(
|
||
self,
|
||
model: str = "gemini-embedding-001",
|
||
dim: int = EMBED_DIM,
|
||
api_key: str | None = None,
|
||
batch: int = 100,
|
||
):
|
||
from google import genai
|
||
|
||
self._client = genai.Client(api_key=api_key or os.environ["GEMINI_API_KEY"])
|
||
self.model = model
|
||
self.dim = dim
|
||
self.batch = batch
|
||
|
||
def encode(
|
||
self,
|
||
texts,
|
||
normalize_embeddings: bool = True,
|
||
task_type: str = "RETRIEVAL_DOCUMENT",
|
||
show_progress_bar: bool = False,
|
||
):
|
||
"""Векторизовать список строк. Возвращает numpy-массив (n, dim) float32.
|
||
|
||
Для справочника используем RETRIEVAL_DOCUMENT, для запросов —
|
||
RETRIEVAL_QUERY: так несвязанные названия расходятся сильнее, чем при
|
||
SEMANTIC_SIMILARITY, и порог отсечения работает надёжнее.
|
||
"""
|
||
from google.genai import types
|
||
|
||
items = [t if t and t.strip() else " " for t in texts]
|
||
config = types.EmbedContentConfig(task_type=task_type, output_dimensionality=self.dim)
|
||
vectors: list[list[float]] = []
|
||
for start in range(0, len(items), self.batch):
|
||
chunk = items[start : start + self.batch]
|
||
response = self._client.models.embed_content(model=self.model, contents=chunk, config=config)
|
||
vectors.extend(embedding.values for embedding in response.embeddings)
|
||
|
||
array = np.array(vectors, dtype=np.float32)
|
||
if normalize_embeddings:
|
||
array = array / np.clip(np.linalg.norm(array, axis=1, keepdims=True), 1e-9, None)
|
||
return array
|