ProxyWing

UTF-8

Publicado: 22 de octubre de 2025
Última actualización: 2 de noviembre de 2025

¿Qué es UTF-8?

UTF-8 es un estándar de codificación de longitud variable. Está diseñado dentro del estándar Unicode para representar datos de texto de forma compacta y retrocompatible. En formato UTF-8, los puntos de código (que Unicode utiliza para asignar los caracteres) se traducen a entre uno y cuatro bytes.

El formato UTF-8 también es compatible con ASCII, y hoy muchos archivos de texto lo utilizan de forma predeterminada. UTF-8 representa todos los sistemas de escritura en un estándar de codificación unificado entre sistemas distintos. Así no necesitamos depender de páginas de códigos heredadas ni de formatos de codificación heredados.

Cómo usar UTF-8 en páginas web

Debe declarar la codificación UTF-8 en HTML para que sus páginas se representen correctamente. Normalmente, añadimos lo siguiente en la sección <head>:

<meta charset=”utf-8″>

Esta configuración indica al navegador que la página utiliza el formato UTF-8. Sin esta configuración, los caracteres que van más allá de ASCII pueden romperse o no representarse correctamente.

UTF-8 admite una amplia gama de conjuntos de caracteres. Por eso, los estándares web como HTML5 lo utilizan de forma predeterminada. Al trabajar con datos de texto, conviene usar caracteres UTF-8 de forma coherente para que su sitio web pueda manejar Unicode correctamente en distintos idiomas.

En comparación con UTF-16, el formato UTF-8 aprovecha mejor el espacio en textos con abundancia de caracteres ASCII.

Cómo funciona la codificación UTF-8

En la codificación UTF-8, cada punto de código o valor de punto (un número asignado por Unicode) se convierte en una secuencia de 1 a 4 bytes. El primer byte de esa secuencia indica cuántos bytes en total vendrán a continuación. Por ejemplo:

  • Para los puntos de código 0–127, basta con un solo byte.
  • Los puntos de código más grandes utilizan secuencias de bytes. El primer byte empieza con bits como 110, 1110 o 11110, que indican 2, 3 o 4 bytes.
  • Los bytes siguientes siempre empiezan con 10 para indicar la continuación.

Este esquema de caracteres UTF-8 válidos evita solapamientos. Como el primer byte señala la longitud de la secuencia, los decodificadores pueden analizarla sin confusión.

Ejemplos de UTF-8 en etiquetas HTML

A continuación se muestra un ejemplo de código HTML5:

<!DOCTYPE html>
<html lang=”en”>
<head>
  <meta charset=”UTF-8″>
  <title> Example</title>
</head>
<body>
  <p>Some English text</p>
</body>
</html>

La etiqueta <meta charset> permite que esos caracteres se asignen correctamente. Se recomienda usar codificaciones estándar para que los navegadores interpreten las mismas secuencias de bytes como los mismos caracteres

¿Tiene alguna pregunta?