Retrofitted LLM can count the letter ‘i’ in ‘artificial intelligence’Een aangepaste LLM kan de letter ‘i’ tellen in ‘artificial intelligence’Un LLM adapté peut compter la lettre « i » dans « artificial intelligence »
Nature · 8 October 2026, at 03:02
Most LLMs struggle to count letters because they process words as tokens rather than individual characters. A technique called byteification retrofits these existing models so they can work directly with the bytes that encode each character. The researchers show that byteified models can deliver competitive performance while gaining the ability to inspect text letter by letter. So, that familiar “how many i’s?” question could become a much fairer test of what an AI can actually read.Veel grote taalmodellen hebben moeite met letters tellen, omdat ze woorden verwerken als tokens in plaats van als afzonderlijke tekens. Met een techniek die byteification heet, kunnen bestaande modellen worden aangepast zodat ze rechtstreeks werken met de bytes waarin elk teken is gecodeerd. De onderzoekers laten zien dat zulke modellen goed kunnen presteren en tegelijk tekst letter voor letter kunnen bekijken. Zo wordt de bekende vraag hoeveel keer een letter voorkomt een eerlijkere test van wat AI echt kan lezen.Les grands modèles de langage ont souvent du mal à compter les lettres, car ils traitent les mots sous forme de jetons plutôt que de caractères individuels. Une technique appelée « byteification » adapte ces modèles pour qu’ils puissent travailler directement avec les octets qui encodent chaque caractère. Les chercheurs montrent que ces modèles adaptés peuvent rester performants tout en analysant le texte lettre par lettre. Voilà qui pourrait rendre la question familière « combien de i ? » bien plus juste pour évaluer ce qu’une IA sait réellement lire.