Nyelvi technológia támogatottság
LOKALIZÁCIÓ

Multilingual chatbotok

Megközelítések

Többnyelvű chatbotok három fő architektúrával implementálhatók:

  • Nyelvenkénti modell — külön NLP pipeline minden nyelvhez (legjobb minőség, legnagyobb karbantartás)
  • Multilingual modell — egy modell több nyelven (mBERT, XLM-RoBERTa)
  • Translate-then-process — bemenet fordítása közös nyelvre, feldolgozás, válasz visszafordítása

Magyar nyelv

A magyar nyelv morfológiai gazdagsága kihívást jelent az NLP modellek számára. A spaCy hu_core_news_md modell alapvető tokenizációt, POS tagging-et és NER-t biztosít. Intent classification-höz érdemes magyar-specifikus tanító adatot használni — az angol adatokon betanított modellek gyengén teljesítenek magyar bemeneten.

A Hugging Face-en elérhető magyar nyelvű modellek (pl. NYTK/sentence-transformers-experimental) használhatók szemantikus kereséshez és hasonlóság-számításhoz.

Fordítási pipeline

A translate-then-process megközelítés egyszerűsíti a karbantartást: egy angol NLP pipeline-t használunk, a bemenetet és kimenetet fordítjuk. A Google Cloud Translation API vagy a DeepL API integrálható. A fordítási minőség közvetlenül befolyásolja az NLP pontosságot — domain-specifikus kifejezéseknél custom glossary ajánlott.

Lokalizáció

A lokalizáció túlmutat a fordításon: dátumformátumok (2026.06.24.), pénznem (Ft), udvariassági formulák és kulturális kontextus is számít. A válaszsablonok nyelvenként külön fájlban tárolhatók JSON formátumban. A nyelvváltás a session szintjén történik — a felhasználó első üzenetéből vagy explicit választásból detektálható.