top of page
Derniers écrits


Ce qui compte comme preuve en transfert KV cross-modèle
Trois articles récents revendiquent tous le transfert KV "cross-model". Chacun glisse une béquille qui rétrécit ce que le mot veut dire. Voici la barre à franchir qui rendrait le claim strict falsifiable. Le transfert KV cross-modèle porte une affirmation précise et séduisante : un modèle de langage fait le prefill coûteux, un autre modèle décode à partir de l'état obtenu, et le second ne relit jamais le prompt. Si cela fonctionnait, le contexte cesserait d'être une séquence
7 juil.


La prédiction n'a pas de marche arrière
Un LLM ne raisonne pas et ne vérifie pas. Ce ne sont pas deux limites séparées — c'est la même propriété architecturale, vue sous deux angles. J'ai publié deux articles sur Medium qui semblaient traiter de deux problèmes différents. Le premier, Le cadavre exquis — pourquoi un LLM ne raisonne pas (janvier 2026), soutenait que les modèles de langage ne raisonnent pas. Ils continuent. Le jeu du cadavre exquis — où chaque joueur ajoute un mot à une phrase que personne ne contrôle
20 juil.


23 545 tokens par requête : mesurer le coût du re-prefill dans les agents de code
Ce que j'ai mesuré. Ce que j'ai appris. Ce que ça implique pour le design du KV cache. En 2026, les équipes d'ingénierie se réveillent avec des factures LLM qui rivalisent avec leur infrastructure cloud. Une part significative de ce coût ne va pas dans du travail nouveau — il va dans le retraitement du même contexte, tour après tour, conversation après conversation. J'ai voulu mesurer exactement combien. J'ai donc configuré Claude Code pour pointer vers mon propre runtime d'i
6 juil.
bottom of page