Remplace TechStepClassifierService's node-nlp (NlpManager) par services/tech-step-intent-service, un microservice FastAPI/spaCy dedie (PhraseMatcher pour le NER par synonymes, textcat pour la classification d'intention). Corpus (TECH_STEP_TRAINING_DATA) toujours possede par apps/api, pousse au service via POST /v1/train a chaque warm-up ; le service ne touche jamais Postgres (meme posture que services/tech-step-llm-worker). Cote apps/api : - intent-service-client.ts : client HTTP vers le nouveau service - tech-step-matcher.ts : delegue NER + intent classification au client, logique pure (splitIntoClauses, seuil/fallback) inchangee - env.ts : INTENT_SERVICE_BASE_URL/INTENT_SERVICE_SECRET (secret requis, service coeur non optionnel) - server.ts : warm-up avec retry/backoff (service Python demarre a part) - scripts/calibrate-tech-step-threshold.ts : recalibration empirique de CONFIDENCE_THRESHOLD contre le jeu d'eval existant - node-nlp retire (package.json, node-nlp.d.ts, model.nlp du .gitignore) docker-compose.yml : nouveau service tech-step-intent-service (pas de port expose, healthcheck, app en depend). CI : job intent-service-test (pytest) + le job test demarre le service en arriere-plan avant la suite Mocha (jamais de mock d'un service interne, cf specs/dev-conventions.md). Verifie : 26/26 tests pytest du service (dont les offsets caracteres exacts de tech-step-matcher.test.ts), lint + build complets du monorepo, smoke test HTTP reel bout en bout. La suite Mocha et docker compose build/up n'ont pas pu etre executes dans cet environnement (pas de Postgres/Docker disponibles ici) — a confirmer via la CI et en local. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
32 lines
1.5 KiB
Python
32 lines
1.5 KiB
Python
"""Port Python de `normalizeText` (`apps/api/src/lib/recipe-matching/tech-step-matcher.ts`).
|
|
|
|
Doit rester bit-pour-bit équivalent à sa contrepartie TypeScript — c'est ce
|
|
qui garantit qu'un synonyme matché ici tombe exactement sur les mêmes
|
|
positions caractère que ce que `apps/api` attendait de node-nlp (voir
|
|
`LocalePipeline`'s `diacritics_normalizer`, qui applique cette fonction aux
|
|
patterns *et* au texte cible pour les faire matcher identiquement).
|
|
|
|
TypeScript original :
|
|
|
|
const COMBINING_DIACRITICS_PATTERN = /\\p{Diacritic}/gu;
|
|
export function normalizeText(text: string): string {
|
|
return text.normalize("NFD").replace(COMBINING_DIACRITICS_PATTERN, "").toLowerCase();
|
|
}
|
|
|
|
`unicodedata.combining(ch) != 0` (catégories Unicode Mn/Mc, la classe de
|
|
combinaison canonique) est l'idiome Python standard pour "strip accents
|
|
after NFD" — légèrement plus étroit que `\\p{Diacritic}` en théorie (qui
|
|
couvre aussi quelques diacritiques autonomes hors caractères combinants),
|
|
mais strictement équivalent pour tout caractère latin accentué usuel
|
|
(français/anglais) une fois décomposé en NFD, ce qui est le seul cas
|
|
réellement exercé par ce corpus.
|
|
"""
|
|
|
|
import unicodedata
|
|
|
|
|
|
def normalize_text(text: str) -> str:
|
|
"""Décompose en NFD, retire les marques combinantes (accents), met en minuscule."""
|
|
decomposed = unicodedata.normalize("NFD", text)
|
|
stripped = "".join(char for char in decomposed if not unicodedata.combining(char))
|
|
return stripped.lower()
|