Prétraitement = rendre le texte « exploitable » avant l’apprentissage automatique.
Nettoyage = enlever ; Normalisation = mettre tous les textes à la même « échelle ».
Tokens pour découper, NER pour nommer, POS pour classer.
BoW compte ; TF-IDF nuance ; Embeddings remplacent les mots par des vecteurs.
Multilingue = mélange + morphologie + alphabets, donc on commence par détecter la langue.
3 chemins : adapter, traduire, ou utiliser un modèle multilingue.
| Aspect | Nettoyage | Normalisation |
|---|---|---|
| But | Supprimer l’indésirable | Uniformiser l’écriture |
| Cible | Réduction du bruit | Réduction de la variabilité |
| Exemples | Stopwords, balises HTML | Minuscules, suppression accents, stemming/lemmatisation |
| Stratégie | Idée centrale | Point faible |
|---|---|---|
| Prétraitement spécifique | Pipeline adapté après détection | Nécessite plusieurs outils et ressources |
| Langue pivot | Traduire puis prétraiter | Traduction imparfaite et perte d’information |
| Modèles multilingues | Modèles pré-entraînés multi-langues | Plus lourd et nécessite GPU |
Metti alla prova le tue conoscenze su Introduction aux Techniques de Prétraitement NLP con 12 domande a scelta multipla con correzioni dettagliate.
1. Quel est l’objectif principal du prétraitement du texte avant l’apprentissage automatique ?
2. Quelle situation illustre le mieux la variabilité linguistique ?
Memorizza i concetti chiave di Introduction aux Techniques de Prétraitement NLP con 12 flashcard interattive.
Prétraitement linguistique — définition ?
Opérations pour rendre le texte exploitable par NLP.
Bruit linguistique — exemple ?
Caractères, ponctuations inutiles, balises HTML.
Variabilité linguistique — cause ?
Différences d’écriture pour un même terme.
Importa il tuo corso e l'AI genera schede, quiz e flashcard in 30 secondi.
Generatore di schede