ForHosting KIT · Outils pour développeurs

Supprimer les signes diacritiques Unicode d’un texte

Cet outil supprime les signes diacritiques combinatoires d’un texte Unicode après sa décomposition canonique.

● BetaGratuit · dans votre navigateur
Utilisez-le depuis WebAPIE-mailTelegramApp bientôt

Les lettres accentuées comme é, ñ et ü retrouvent leur forme de base, tandis que la ponctuation, les espaces, les symboles, la casse et les écritures sans rapport restent intacts. Le résultat convient lorsqu’un index de recherche, un identifiant, un nom de fichier ou un slug exige une représentation insensible aux accents, sans translittération générale ni règle orthographique propre à une langue. Le traitement est déterministe, limité à la requête, et renvoie un texte simple que vous pouvez copier ou transmettre directement à une autre étape de normalisation.

Comprendre la transformation

Unicode peut représenter de plusieurs façons de nombreuses lettres accentuées. Un caractère tel que é peut être stocké sous la forme d’un seul point de code précomposé, ou d’une lettre de base e suivie d’un accent aigu combinatoire. Une comparaison visuelle ne permet pas de savoir quelle représentation est présente. Cette capacité applique d’abord la décomposition canonique Unicode, généralement appelée NFD, afin d’exprimer les caractères décomposables sous forme de caractères de base suivis de leurs marques. Elle supprime ensuite les caractères de toutes les catégories de marques Unicode. Ainsi, café, piñata et Ångström deviennent cafe, pinata et Angstrom. Elle ne met pas le texte en minuscules, ne réduit pas les espaces, ne retire pas la ponctuation et ne remplace pas les symboles. Elle ne garantit pas non plus une translittération ASCII complète : une lettre sans décomposition canonique, comme ł, reste inchangée. Cette portée restreinte est volontaire. Vous disposez ainsi d’une primitive prévisible, à associer à vos propres règles de casse, de ponctuation ou de création de slugs, sans transformations cachées.

Créer des clés de recherche et des slugs stables

Une recherche insensible aux accents fonctionne souvent mieux lorsque la valeur d’origine et une clé normalisée sont enregistrées séparément. Conservez l’orthographe originale pour l’affichage, puis soumettez le texte à cette capacité pour produire un champ de comparaison. Vous pouvez appliquer le même traitement à une requête avant la mise en correspondance : une personne qui saisit cafe trouvera alors café, sans que le libellé correctement accentué disparaisse des résultats. Dans une chaîne de création de slugs, utilisez la sortie au début du processus : supprimez les marques, passez ensuite en minuscules, remplacez les espaces, puis appliquez la politique de ponctuation de votre projet. L’ordre est important, car la décomposition expose des marques qui resteraient autrement attachées aux lettres précomposées. L’opération est déterministe : une même entrée Unicode produit toujours la même sortie et convient donc aux clés de cache ou aux préparations de données reproductibles. Elle ne remplace toutefois pas un classement adapté à la langue. Selon les langues, une lettre accentuée peut être une variante ou une lettre distincte ; gardez le texte original et n’activez cette comparaison que lorsque votre usage le justifie.

Limites, écritures et contrôles

La règle couvre les signes combinatoires de l’ensemble d’Unicode, et pas seulement la plage d’accents courante dans les langues d’Europe occidentale. Cette cohérence technique peut avoir un effet important sur les systèmes d’écriture où les marques portent une information essentielle. Testez des contenus représentatifs de chaque langue acceptée par votre application avant d’utiliser le résultat dans une recherche, une route ou un champ d’identité. Les sélecteurs de variante des emoji et d’autres caractères classés comme marques peuvent également disparaître : considérez donc la sortie comme une clé normalisée, et non comme une copie destinée à l’affichage. La décomposition canonique se distingue volontairement de la décomposition de compatibilité. Les formes décoratives ou compatibles ne sont pas toutes simplifiées, et l’outil ne prétend pas assurer une translittération générale. Pour contrôler le résultat, comparez les graphies précomposée et décomposée d’un même exemple et vérifiez leur égalité. Ajoutez à vos tests de la ponctuation, du texte non latin, des emoji et des lettres sans décomposition. Vous saurez ainsi si cette opération ciblée suffit ou si votre chaîne nécessite d’autres étapes explicitement choisies.

Créer des clés de recherche sans accents

Enregistrez une valeur normalisée parallèle afin que les requêtes sans accents retrouvent les noms et termes correctement orthographiés.

Préparer du texte pour des slugs d’URL

Ramenez les lettres accentuées décomposables à leur base avant d’appliquer les règles de casse, de séparateurs et de ponctuation.

Comparer des représentations Unicode différentes

Ramenez les graphies précomposées et combinatoires à la même représentation de lettres de base pour une comparaison déterministe.

Que supprime cette capacité ?

Elle applique la décomposition canonique Unicode et retire les caractères des catégories de marques Unicode, notamment les signes diacritiques combinatoires.

Convertit-elle tout le texte en ASCII ?

Non. Les caractères sans décomposition canonique en lettre de base restent inchangés, tout comme la ponctuation, les symboles et les autres écritures.

Met-elle le texte en minuscules ou crée-t-elle un slug complet ?

Non. La mise en minuscules, le remplacement des espaces, le filtrage de la ponctuation et les séparateurs doivent faire l’objet d’étapes explicites ultérieures.

Les accents précomposés et décomposés donnent-ils le même résultat ?

Oui. La décomposition canonique précède la suppression des marques ; un é précomposé et un e suivi d’un accent aigu sont donc simplifiés de façon cohérente.

Quel est le prix d’une requête API ?

Chaque requête API coûte $0.002. La transformation convient aussi à l’exécuteur généré dans le navigateur, car elle ne nécessite ni réseau ni état serveur.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/str/remove-diacritic-marks

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/str/remove-diacritic-marks \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"Crème brûlée — déjà vu in São Paulo"}'
{
  "text": "Crème brûlée — déjà vu in São Paulo"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "str.remove_diacritic_marks",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.

Consulter la documentation complète du KIT →