Python - Unicode
Unicode es un sistema para representar caracteres de todos los diferentes idiomas del mundo. Cuando Python analiza un documento XML, todos los datos se almacenan en memoria como Unicode. Antes de Unicode había diferentes sistemas de codificación de caracteres para cada idioma, cada uno usando los mismos números (0-255) para representar los caracteres de ese lenguaje. El problema radicaba cuando se quería intercambiar documentos entre sistemas heterogéneos, restultando difícil, puesto que no había manera de que un ordenador supiera con certeza qué esquema de codificación de caracteres había usado el autor del documentom y los números pueden significar muchas cosas (en japonés el carácter codificado 234 no es el mismo que el carácter codificado ruso 234, ni en español, que 234 es Û). Para resolver este problema Unicode representa cada carácter como un número de 2 bytes (de 0 a 65535). Cada número de 2 bytes representa un único carácter utilizado en al menos un idioma del mundo (los carac...