S.S
Tous les articles
Soufiane Sejjari··6 min

La mémoire, couche manquante des applications LLM

Les fenêtres de contexte s'agrandissent, mais elles oublient toujours. Pourquoi la mémoire persistante et structurée — pas un contexte plus long — rend les assistants LLM réellement utiles.

La mémoire, couche manquante des applications LLM

Chaque assistant LLM aujourd'hui souffre du même défaut fondamental : il vous rencontre pour la première fois, à chaque fois.

Les fenêtres de contexte sont passées de 4k à des millions de tokens. Le problème n'est pas la capacité — c'est la structure. Déverser tout l'historique dans un prompt n'est pas de la mémoire. C'est une transcription.

Ce que la mémoire exige vraiment

Construire iRemember m'a appris que la vraie mémoire nécessite quatre opérations distinctes :

  1. Extraction — séparer les faits durables (« ma sœur habite à Rabat ») du contexte éphémère (« je suis fatigué aujourd'hui »)
  2. Consolidation — fusionner contradictions et mises à jour dans le temps
  3. Récupération — faire remonter le bon souvenir au bon moment, pas les k chaînes les plus similaires
  4. Oubli — oui, oublier. Sans décroissance de pertinence, le système se noie dans sa propre histoire.

La recherche hybride bat la similarité pure

La similarité sémantique seule remonte des souvenirs qui sonnent proches. Ce qu'il faut, ce sont des souvenirs proches et récents et importants.

Notre score combine trois signaux :

score = α · similarité_sémantique
      + β · décroissance_temporelle
      + γ · poids_d_importance

Le poids d'importance est appris à partir de signaux captés à l'extraction : intensité émotionnelle, marqueurs explicites (« retiens ça »), fréquence de référence par d'autres souvenirs.

Les personnes sont des entités de premier ordre

L'intuition derrière iRemember : chaque IA se souvient de vous. Aucune ne se souvient des gens autour de vous. Modéliser les personnes comme entités structurées — avec profils évolutifs et sentiment dans le temps — change les questions auxquelles le système peut répondre. Pas « qu'ai-je dit sur X » mais « comment ma relation avec X évolue ».

C'est la différence entre un moteur de recherche sur votre passé et un véritable assistant.

#LLM#Mémoire#RAG

FAQ

Les fenêtres de contexte plus longues rendent-elles la mémoire LLM inutile ?

Non. Elles résolvent la capacité, pas la structure. Les recherches sur le dialogue long-contexte montrent que les modèles oublient encore des faits dispersés propres à l’utilisateur et perdent le fil temporel. Une mémoire persistante et structurée avec récupération sélective reste nécessaire.

Comment fonctionne le score de récupération hybride ?

Chaque souvenir est noté comme une combinaison pondérée de similarité sémantique, de décroissance temporelle et d’un poids d’importance appris à partir de signaux captés à l’extraction : intensité émotionnelle, marqueurs explicites de rétention, fréquence de référence par d’autres souvenirs.

Quel est le meilleur système de mémoire LLM open source en 2026 ?

Mem0 est la baseline la plus courante, mais les travaux de 2026 (AdaMem, PerMem-Bench, MemMachine) montrent que l’extraction uniforme « tout retenir » provoque une inflation de la mémoire. Des pipelines LangGraph personnalisés avec politiques de contrôle d’écriture surpassent désormais l’extraction uniforme en précision et en volume.

Soufiane Sejjari

Ingénieur logiciel · Chercheur en IA