Visionneuse d’octets UTF-8
Collez un texte pour voir combien d’octets prend chaque caractère et lesquels, en UTF-8 ou, si vous préférez, en UTF-16 et UTF-32.
Traité localement dans votre navigateur/ Vos données restent dans votre navigateur.
Qu'est-ce que Visionneuse d’octets UTF-8 ?
UTF-8 stocke chaque point de code Unicode sur un à quatre octets : l’ASCII en prend un, les lettres latines accentuées, grecques, cyrilliques, hébraïques et arabes en prennent deux, la plupart du reste du plan multilingue de base (dont € et le CJK) en prend trois, et les emoji en prennent quatre. Le premier octet indique la longueur de la séquence ; les suivants commencent toujours par les bits 10.
Ce visualiseur liste une ligne par point de code ou par caractère visible, avec son nombre d’octets, les octets en hex, binaire et décimal et le motif de bits UTF-8 qu’il remplit. Un résumé donne le total d’octets, la moyenne par caractère, si le texte est purement ASCII et sa taille en UTF-8, UTF-16 et UTF-32. Vous pouvez passer en UTF-16 ou UTF-32 dans les deux ordres d’octets et ajouter un BOM.
Comment ça marche ?
- Saisissez ou collez votre texte : le tableau et le flux d’octets se mettent à jour en direct.
- Choisissez l’encodage (UTF-8 par défaut) et si une ligne correspond à un point de code ou à un graphème.
- Choisissez le format du flux d’octets (hex, binaire, décimal ou octal) et activez le BOM si nécessaire.
- Consultez le résumé pour la taille totale, puis copiez le flux d’octets.
Cas d'usage courants
- Comprendre pourquoi une chaîne est plus longue en octets qu’en caractères quand elle dépasse une colonne de base de données ou la limite d’une API.
- Vérifier les octets exacts d’un caractère non ASCII avant d’écrire un jeu de tests ou un message de protocole binaire.
- Comprendre le mojibake : voir que é vaut C3 A9 en UTF-8 et s’affiche donc é quand on le lit en Latin-1.
- Comparer la place qu’occupe le même texte en UTF-8, UTF-16 et UTF-32.
Exemples
Essayez cette saisie dans l'outil ci-dessus :
Héllo €😀
48 C3 A9 6C 6C 6F 20 E2 82 AC F0 9F 98 80
Confidentialité
Visionneuse d’octets UTF-8 s'exécute entièrement dans votre navigateur. Le texte ou les fichiers que vous fournissez sont traités sur votre appareil et ne sont ni envoyés, ni journalisés, ni stockés sur nos serveurs.
Limites
L’outil montre comment un texte est encodé, pas le contenu d’un fichier sur disque : utilisez un visualiseur hexadécimal pour cela. Les substituts isolés ne s’encodent pas en UTF-8 ni en UTF-32 et apparaissent comme U+FFFD. Seuls les 100 000 premiers caractères sont analysés.
Questions fréquentes
Combien d’octets pèse un emoji en UTF-8 ?
Presque toujours quatre, car les emoji se trouvent au-delà de U+FFFF. Une séquence comme un emoji famille assemble plusieurs emoji par des jointeurs de largeur nulle (3 octets chacun) et peut atteindre 18 octets ou plus.
En quoi diffère-t-il de l’inspecteur Unicode ?
L’inspecteur décrit les caractères : catégorie, écriture, entité HTML. Cet outil se concentre sur les octets : tailles, motifs de bits, plusieurs encodages, ordre des octets et BOM.
Pourquoi UTF-16 et UTF-32 donnent-ils d’autres octets pour le même texte ?
UTF-16 utilise deux ou quatre octets et UTF-32 toujours quatre ; les deux dépendent de l’ordre des octets (little ou big endian). UTF-8 n’a pas ce problème, ce qui explique en partie sa domination sur le web.
Outils associés
Inspecteur de Caractères Unicode
Collez un texte ou un emoji et voyez précisément de quels points de code, octets et écritures il est fait.
Encodage & décodage
Convertisseur Texte en Hexadécimal
Voyez les octets exacts derrière n’importe quel texte, d’un simple « Bonjour » aux emoji, au format qu’attendent votre code ou votre débogueur.
Encodage & décodage
Convertisseur Texte en Binaire
Transformez des mots en 0 et en 1 : chaque octet de votre texte est affiché sur huit bits.
Encodage & décodage
Convertisseur Texte en Décimal
Obtenez le numéro Unicode de chaque caractère : « é » vaut 233, « 世 » 19990 et 😀 128512.
Encodage & décodage
Chercheur de point de code (recherche Unicode)
Saisissez des points de code dans n’importe quelle notation courante, ou une plage, et obtenez les caractères avec leurs formes décimale, hex, UTF-8, UTF-16 et entité HTML.
Encodage & décodage
Visionneuse hexadécimale
Déposez un fichier pour voir ses octets bruts dans la disposition familière offset | hexa | ASCII, avec son type détecté et sa taille.
Outils de fichiers
Compteur de caractères
Découvrez la longueur exacte de votre texte en caractères, points de code Unicode et octets, et ce qu’il reste avant une limite.
Outils de texte
Convertisseur d’Échappement Unicode
Transformez é, ☕ et 😀 en \u00E9, \u2615 et \uD83D\uDE00 (ou un autre style) pour du code source, du JSON ou du CSS.
Encodage & décodage