Changement d'architecture demande par l'utilisateur : le dataset d'entrainement (TECH_STEP_TRAINING_DATA) quitte apps/api pour vivre entierement dans services/tech-step-intent-service (intent_service/training_data.py). Ce service est desormais autonome : il s'entraine lui-meme une seule fois, a son propre demarrage (PipelineRegistry.initialize, dans le lifespan FastAPI), sans plus dependre d'un POST /v1/train pousse par apps/api (route supprimee). apps/api ne connait plus aucune technique/synonyme, uniquement le resultat de POST /v1/process. Corpus enrichi avec les 48 techniques du lexique fourni (Arroser, Appertiser, Braiser, Caraméliser, Confire, Julienne/Brunoise/Mirepoix/ Paysanne, Cuire à blanc/au bain-marie/à l'étouffée, Déglacer variantes, Emulsionner, Glacer, Pocher, Réduire, Suer, Zester, etc.), soit 74 techniques au total (26 + 48). Integration complete bout en bout : - reference-seed-data.ts : 48 nouvelles entrees TECH_STEPS - apps/web/locales/fr/translation.json : libelles francais correspondants - "Mitonner" fondu comme synonyme de simmer (pas une technique distincte, sa propre definition le dit) - "Blanchir un oeuf" (whiskPale) distingue de "Blanchir un legume" (blanch, existant) via des synonymes en phrase complete plutot qu'au mot nu — filter_spans (deja en place) resout la collision par specificite Impact performance mesure : le corpus elargi (74 classes vs 26) rend l'entrainement bien plus lent a nombre d'iterations egal (150 iterations depassait 17 minutes par run de test) — reduit a 40 iterations apres mesures repetees en local (~200s/locale, ~400s pour fr+en combines). docker-compose.yml (healthcheck start_period 600s), CI (timeout curl 600s) et le README du service documentent ce nouveau temps de demarrage. CONFIDENCE_THRESHOLD recalibre a 0.2 par verification manuelle (0.75 puis 0.45 ne tenaient plus compte tenu du nombre de classes) — marque explicitement comme placeholder en attendant une vraie repasse de calibrate-tech-step-threshold.ts (necessite Postgres, indisponible dans cet environnement). Verifie : 28/28 tests pytest du service (suite complete re-ecrite pour s'entrainer une seule fois par session sur le vrai corpus, fixture partagee dans conftest.py), lint + build complets du monorepo. La suite Mocha d'apps/api reste a confirmer via CI (le root hook mocha n'attend plus l'entrainement, seulement CI's propre attente sur /health). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
51 lines
2.1 KiB
Python
51 lines
2.1 KiB
Python
"""Contrat JSON de `POST /v1/process` — voir `schemas.py`/`routes/process.py`.
|
|
|
|
Le service s'entraîne désormais lui-même au démarrage sur le vrai corpus
|
|
(`training_data.TECH_STEP_TRAINING_DATA`, voir `conftest.py`'s fixture
|
|
`client` partagée) — ces tests vérifient donc le contrat HTTP contre des
|
|
phrases réelles du corpus, plus besoin d'un `POST /v1/train` préalable avec
|
|
des données jouets.
|
|
"""
|
|
|
|
from fastapi.testclient import TestClient
|
|
|
|
from intent_service.config import settings
|
|
|
|
_HEADERS = {"X-Intent-Service-Secret": settings.intent_service_secret}
|
|
|
|
|
|
def test_process_against_an_unsupported_locale_returns_empty_result(client: TestClient):
|
|
# "de" n'a aucun modèle spaCy connu (`SUPPORTED_LOCALES`) — se comporte
|
|
# comme "jamais entraîné" côté `/v1/process`, jamais une erreur (voir
|
|
# `PipelineRegistry.process`).
|
|
response = client.post(
|
|
"/v1/process", headers=_HEADERS, json={"locale": "de", "text": "faire mijoter à feu doux"}
|
|
)
|
|
assert response.status_code == 200
|
|
assert response.json() == {"entities": [], "intent": None, "score": 0.0}
|
|
|
|
|
|
def test_process_returns_entities_and_intent_for_a_real_corpus_sentence(client: TestClient):
|
|
response = client.post(
|
|
"/v1/process", headers=_HEADERS, json={"locale": "fr", "text": "Faire mijoter à feu doux"}
|
|
)
|
|
assert response.status_code == 200
|
|
body = response.json()
|
|
assert body["intent"] == "simmer"
|
|
assert body["score"] > 0
|
|
assert [entity["uid"] for entity in body["entities"]] == ["simmer"]
|
|
|
|
|
|
def test_process_matches_english_text_against_the_english_trained_vocabulary(client: TestClient):
|
|
response = client.post(
|
|
"/v1/process", headers=_HEADERS, json={"locale": "en", "text": "Chop the onions finely"}
|
|
)
|
|
assert response.status_code == 200
|
|
body = response.json()
|
|
assert [entity["uid"] for entity in body["entities"]] == ["chop"]
|
|
|
|
|
|
def test_process_with_blank_text_returns_empty_result(client: TestClient):
|
|
response = client.post("/v1/process", headers=_HEADERS, json={"locale": "fr", "text": " "})
|
|
assert response.status_code == 200
|
|
assert response.json() == {"entities": [], "intent": None, "score": 0.0}
|