Adatgyűjtés
Az NLP modell minőségének alapja a reprezentatív tanító adat. Források: meglévő ügyfélszolgálati logok, szintetikus adatgenerálás, crowd-sourcing címkézés, domain szakértők által írt példamondatok.
Kezdeti fázisban 50–100 intentenkénti példa elegendő a baseline modellhez. A produkciós finomhangoláshoz folyamatos adatgyűjtés szükséges a valós felhasználói interakciókból — anonimizálás után.
Címkézés
Az intent címkézés egyszerű: minden mondat egy kategóriába tartozik. Az NER címkézés token-szintű BIO annotációt igényel, amely időigényesebb. Eszközök: Label Studio, Doccano, Prodigy (spaCy).
A címkézési útmutató (annotation guideline) dokumentálja a döntési szabályokat: mi számít egy intent határának, hogyan kezeljük az többintent-es mondatokat, mi a protokoll bizonytalan eseteknél.
Minőségbiztosítás
Inter-annotator agreement (Cohen's kappa) mérése biztosítja a címkézés konzisztenciáját. Célérték: kappa > 0.8. Dupla címkézés és reviewer folyamat csökkenti a hibás annotációk arányát.
Az adatkészlet split tipikusan 70/15/15 (train/validation/test). A test készlet soha ne kerüljön a tanításba — különben túlbecsljük a modell teljesítményét.
Formátumok
Intent adatok JSONL formátumban:
{"text": "Módosítani szeretném a címem", "intent": "modify_address"}
NER adatok CoNLL vagy spaCy DocBin formátumban. A Rasa NLU formátum YAML-ban definiálja az intenteket és példákat — jól integrálható Rasa-alapú projektekhez.