Prétraitement = rendre le texte « exploitable » avant l’apprentissage automatique.
Nettoyage = enlever ; Normalisation = mettre tous les textes à la même « échelle ».
Tokens pour découper, NER pour nommer, POS pour classer.
BoW compte ; TF-IDF nuance ; Embeddings remplacent les mots par des vecteurs.
Multilingue = mélange + morphologie + alphabets, donc on commence par détecter la langue.
3 chemins : adapter, traduire, ou utiliser un modèle multilingue.
| Aspect | Nettoyage | Normalisation |
|---|---|---|
| But | Supprimer l’indésirable | Uniformiser l’écriture |
| Cible | Réduction du bruit | Réduction de la variabilité |
| Exemples | Stopwords, balises HTML | Minuscules, suppression accents, stemming/lemmatisation |
| Stratégie | Idée centrale | Point faible |
|---|---|---|
| Prétraitement spécifique | Pipeline adapté après détection | Nécessite plusieurs outils et ressources |
| Langue pivot | Traduire puis prétraiter | Traduction imparfaite et perte d’information |
| Modèles multilingues | Modèles pré-entraînés multi-langues | Plus lourd et nécessite GPU |
Pon a prueba tus conocimientos sobre Introduction aux Techniques de Prétraitement NLP con 12 preguntas de opción múltiple con correcciones detalladas.
1. Quel est l’objectif principal du prétraitement du texte avant l’apprentissage automatique ?
2. Quelle situation illustre le mieux la variabilité linguistique ?
Memoriza los conceptos clave de Introduction aux Techniques de Prétraitement NLP con 12 tarjetas de memoria interactivas.
Prétraitement linguistique — définition ?
Opérations pour rendre le texte exploitable par NLP.
Bruit linguistique — exemple ?
Caractères, ponctuations inutiles, balises HTML.
Variabilité linguistique — cause ?
Différences d’écriture pour un même terme.
Importa tu curso y la IA genera hojas, cuestionarios y tarjetas de memoria en 30 segundos.
Generador de hojas