Limpiar texto copiado
El texto pegado desde sitios web, PDFs y documentos de Word suele traer espacios de ancho cero y guiones suaves que rompen la búsqueda y la coincidencia. Pégalo aquí, elimínalos, copia el texto limpio de vuelta.
Herramienta de texto
Pega texto y el detector resalta cada carácter Unicode invisible que encuentra: espacios de ancho cero, joiners, marcas direccionales y guiones suaves, cada uno etiquetado con su punto de código.
Los caracteres Unicode invisibles existen por razones legítimas: control de salto de línea, unión de escrituras cursivas, texto bidireccional, silabación opcional. Pero como se renderizan como nada, también son una herramienta de abuso. El paper Trojan Source (CVE-2021-42574, divulgado en octubre de 2021) demostró que los caracteres de override bidireccional podían hacer que el código fuente compilase de forma distinta a como se lee en pantalla. La divulgación complementaria (CVE-2021-42694) cubrió los ataques de homoglifos, donde una а cirílica (U+0430) reemplaza una a latina (U+0061) en un nombre de función. Más cerca del uso cotidiano, los caracteres de ancho cero se pegan en nombres de usuario e identificadores para que dos cadenas que se ven idénticas comparen como diferentes. Un detector que saque a la luz estos caracteres por punto de código es la forma más rápida de encontrarlos, porque no se pueden ver a simple vista.
El texto pegado desde sitios web, PDFs y documentos de Word suele traer espacios de ancho cero y guiones suaves que rompen la búsqueda y la coincidencia. Pégalo aquí, elimínalos, copia el texto limpio de vuelta.
Dos nombres de usuario que se leen como «admin» pueden ser cadenas distintas si uno contiene un U+200B. Pasa cualquier identificador sospechoso por el detector antes de confiar en una comparación.
Los caracteres de override bidireccional (U+202A a U+202E) pueden esconder lógica en código que parece correcto. Pega cualquier snippet de una fuente no confiable antes de leerlo.
Los ataques de homografía IDN usan caracteres confundibles para registrar dominios parecidos. El detector no resuelve el dominio, pero saca a la luz los caracteres invisibles escondidos en el texto del URL.
Los seis caracteres listados arriba son los más comunes, pero no son el cuadro completo. Un barrido a fondo cubre varios rangos. Los caracteres de formato de ancho cero de U+200B a U+200F cubren oportunidades de salto de línea, joiners y marcas direccionales. U+2060 (word joiner) y U+FEFF (marca de orden de bytes, cuando aparece en medio del flujo) también son de ancho cero. El bloque de override bidireccional —U+202A a U+202E, más U+2066 a U+2069— es lo que explota Trojan Source. U+00AD (guión suave) es invisible hasta que hay un corte de línea. Los rellenos Hangul U+115F y U+3164 y el blanco braille U+2800 no renderizan nada pero ocupan una celda, lo que los hace útiles para esconder contenido a plena vista. La detección de confundibles es un problema relacionado pero distinto: una а cirílica y una a latina son visibles ambas, así que un detector de caracteres no las marca. Para eso necesitas una verificación contra los datos de confusables de Unicode, que mapea los caracteres que se parecen a un esqueleto normalizado.
El detector corre por completo en tu navegador como JavaScript. Ningún texto sale de tu dispositivo, lo cual importa cuando pegas identificadores sensibles o código fuente. Funciona en Chrome, Firefox, Safari, Edge y cualquier navegador moderno en escritorio o móvil. Rastrea los caracteres de ancho cero del rango U+200B a U+200F, los overrides bidireccionales de U+202A a U+202E y de U+2066 a U+2069, el word joiner U+2060, el guión suave U+00AD y la marca de orden de bytes U+FEFF cuando aparece fuera de la primera posición de un archivo. Ojo: marca los caracteres invisibles por punto de código; no detecta homoglifos, que son caracteres visibles que simplemente se parecen a otros.
Cualquier carácter Unicode que se renderice sin un glifo visible. Los comunes son el espacio de ancho cero (U+200B), el joiner de ancho cero (U+200D), el no-joiner de ancho cero (U+200C), las marcas de izquierda a derecha y de derecha a izquierda (U+200E, U+200F) y el guión suave (U+00AD). El detector marca cada uno por punto de código.
Tres fuentes comunes. Copiar de una página web o un PDF importa los caracteres invisibles que estaban en el origen. Un editor o CMS los inserta para control de saltos de línea. O alguien los plantó a propósito: para marcado de agua, para formato, o para que un identificador compare distinto.
Por sí solos, no. Pero en código, nombres de usuario y URLs pueden cambiar cómo se parsea el texto. El ataque Trojan Source (CVE-2021-42574) usó overrides bidireccionales para que los compiladores leyeran una lógica distinta a la que veían los revisores. En nombres de usuario, un U+200B oculto hace que dos cadenas idénticas a la vista comparen como diferentes.
Pega tu texto, haz clic en Analizar y luego en Eliminar Caracteres Ocultos. La herramienta quita todo carácter invisible que detecta y deja el texto visible intacto. Copia el resultado con Copiar Texto Limpio.
No. El detector corre por completo en tu navegador como JavaScript. Nada se sube a un servidor, lo que lo hace seguro para usar con código fuente, credenciales o cualquier texto que no puedas compartir.
No. Los homoglifos son caracteres visibles: una а cirílica (U+0430) se ve idéntica a una a latina (U+0061) pero ambas renderizan normal. Esta herramienta marca caracteres invisibles. Detectar confundibles requiere una verificación contra los datos de confusables de Unicode, que mapea los caracteres parecidos a un esqueleto normalizado.