Tecnologia · · ⏱ 7 min de lectura

L'entropia del coneixement corporatiu

Un RAG no elimina l'entropia del coneixement organitzatiu — la desplaça. Sobre embedding drift, corpus staleness i memòria vectorial que es degrada.

Tota organització creu que resol la seva memòria quan connecta un LLM a la seva documentació interna. Un RAG ben muntat, respostes rellevants en segons, la fi aparent de l’amnèsia corporativa. A la pràctica, comença una amnèsia diferent: més silenciosa, més difícil de diagnosticar, i amb conseqüències que només apareixen quan ja s’han acumulat durant mesos. El coneixement vectoritzat no es preserva. Es degrada per camins que l’enginyeria està començant a anomenar.

Una biblioteca corporativa els llibres de la qual es dissolen en núvols de vectors al fons de la prestatgeria
La memòria no s'ha resolt amb la vectorització — ha canviat de forma.

La il·lusió de la memòria resolta

Durant dècades, la memòria organitzativa es pensava amb dues formes de coneixement: explícit (documentable) i tàcit (encarnat en persones i pràctiques). La bibliografia sobre corporate amnesia descrivia el problema amb precisió: la rotació erosiona la memòria col·lectiva, i el tàcit —la major part— no es documenta bé.

La irrupció del RAG va prometre tancar el cercle. Ja no calia que un humà llegís tota la documentació: un sistema podia indexar-la, vectoritzar-la i respondre preguntes complexes en temps real. La memòria passava d’arxiu passiu a assistent actiu.

I aquí apareix el desplaçament. La memòria no ha estat resolta — ha estat substituïda per una altra. Una memòria vectorial les lleis de degradació de la qual són diferents de les que coneixíem, i per a les quals la majoria d’organitzacions no tenen instrumentació. L’entropia segueix allà. Ha canviat de forma.

Com es degrada un coneixement vectoritzat

Un RAG trosseja documents en chunks, els converteix en vectors mitjançant un model d’embedding, i els emmagatzema en un índex on les consultes cerquen per proximitat semàntica. Aquest mecanisme té quatre rutes conegudes de degradació silenciosa.

Embedding drift. Els models d’embedding evolucionen. Cada nova versió produeix vectors en espais diferents. Quan una organització actualitza el model sense reindexar el corpus, els vectors antics segueixen allà però les consultes noves ja no els arriben bé. La forma més perillosa és la gradual: el sistema segueix responent, només que cada vegada pitjor, sense produir un error visible. Sense mètriques específiques, ningú se n’adona fins que un usuari reporta que “la IA s’ha tornat tonta”.

Corpus staleness. El corpus indexat envelleix. Un manual de 2019 roman quan ja n’hi ha un de 2024. Els documents antics ranquegen més alt per similitud semàntica pura, fins i tot quan existeixen versions noves. La solució no és només actualitzar més sovint: és que la lògica de recuperació necessita entendre el temps, no només la semàntica. Sense frescor com a criteri de rànquing, l’índex premia allò antic per defecte.

Semantic drift en cadenes de raonament. En arquitectures amb múltiples salts, cada subconsulta es recolza en els resultats de l’anterior. Petits errors o desviaments s’acumulen, i la resposta final acaba responent a una pregunta semblant però diferent a l’original. És acumulació, no fallada — el sistema acaba lluny del punt de partida sense que cap pas individual hagi comès un error greu.

Index drift. L’índex deixa de reflectir la font autoritzada. Documents eliminats que segueixen indexats. Chunks apuntant a versions antigues. Embeddings duplicats. La majoria de sistemes RAG en producció no reconcilien el seu índex amb la font de forma periòdica. Quan no funciona la ingesta, l’evidència queda oculta fins que algú la busca.

El que això canvia en l’enginyeria de dades

Quatre decisions concretes emergeixen del panorama.

Tractar l’índex vectorial com un dataset amb cicle de vida, no com un arxiu estàtic. La mentalitat tradicional del knowledge base —carrega’l i consulta’l— no funciona aquí. Un índex vectorial és un sistema viu que requereix reindexació programada, versionat del model d’embedding, i traçabilitat de quin chunk va venir de quin document en quin moment.

Afegir el temps com a dimensió explícita de recuperació. Cap sistema seriós hauria de recuperar per proximitat semàntica sense considerar la frescor. Metadades de timestamp per chunk, polítiques de decay que penalitzin documents antics quan existeixen versions noves, estratègies de recuperació híbrida que combinin semàntica amb recència.

Instrumentar la qualitat de recuperació de forma contínua. Un RAG sense mètriques és opac per defecte. Necessita revisions setmanals que comparin la recuperació actual contra un conjunt de queries de referència —el golden set—, i alertes automàtiques quan la rellevància cau per sota d’un llindar. La degradació no anuncia la seva arribada. Només es detecta si es mesura.

Reconciliar índex i font de forma programada. Almenys una vegada per cicle d’ingesta, un job hauria de verificar que cada document indexat segueix existint a la font autoritzada, amb la versió correcta i sense duplicats. I aquest job hauria de produir un informe accionable, no un “OK” verd que no diu res.

El que aquesta aproximació no resol

Aquestes mesures ataquen la degradació del coneixement vectoritzable. Dues capes queden fora.

La primera és el coneixement tàcit: tot el que sap fer una persona experimentada sense poder-ho explicar, tot el que viu en les converses informals. Res d’això entra en un pipeline d’embeddings. Un RAG ben mantingut sobre documentació explícita no cobreix aquesta pèrdua — pot fins i tot ocultar-la, donant la sensació que la memòria està resolta quan només s’ha resolt la part visible.

La segona és el context interpretatiu. Un chunk recuperat per proximitat pot ser semànticament rellevant i contextualment enganyós. Si un usuari pregunta pels ingressos de Q3 2025, una cerca vectorial pot retornar les dades de 2024 perquè la distància semàntica entre “2024” i “2025” és menyspreable per al model. Un dígit de diferència entre insight correcte i al·lucinació. Els embeddings són bons per a conceptes, no per a especificacions.

L’altre costat: quin tipus de memòria estem delegant

Fins aquí, l’enginyeria. Però la vectorització toca alguna cosa més: quin tipus de coneixement estem privilegiant quan decidim què mereix ser indexat.

Sobre el biaix cap al documentable

La bibliografia clàssica distingia entre coneixement explícit i tàcit precisament perquè reconeixia que no tot el que una organització sap pot ser escrit. La cultura, les pràctiques informals, els criteris que un professional experimentat aplica sense poder articular-los — tot això constitueix la major part del saber real.

Quan la memòria es vectoritza, aquest biaix s’aprofundeix. El sistema només pot recuperar el que algú va decidir documentar, en el format en què es va documentar. El tàcit queda automàticament fora. I pitjor: el sistema no assenyala la seva absència. Respon amb confiança sobre el que sap, sense indicar que existeix una capa que no va arribar a l’índex i que probablement contradiria la seva resposta.

La il·lusió de completitud és el problema. No és que el sistema menteixi — és que el seu silenci sobre el que no sap es llegeix com si no hi hagués res més a saber.

Sobre la memòria com a ecosistema viu

Una memòria organitzativa sana no és un arxiu. És un ecosistema viu on el coneixement es genera en converses, es prova a la pràctica, es refina per correcció col·lectiva, i es preserva per transmissió entre persones. Aquest ecosistema té metabolisme propi: descarta allò obsolet, amplifica allò provat, integra allò nou.

Un RAG ben construït és una infraestructura cognitiva útil, però només una capa dins d’aquest ecosistema. Substituir-lo per l’ecosistema sencer és reduir la memòria viva al seu fòssil vectoritzable. I els fòssils, per precisos que siguin, no evolucionen sols.

Sobre la responsabilitat de qui construeix

Qui construeix un RAG corporatiu pren, moltes vegades sense anomenar-la, una decisió estructural: decideix quina part del coneixement organitzatiu serà accessible i quina part quedarà fora de l’abast del sistema principal. Multiplicada per milers de consultes al dia, aquesta decisió redistribueix el poder interpretatiu a l’organització. El que està indexat es consulta. El que no ho està s’oblida.

Aquesta responsabilitat té tres dimensions en tríada: cobertura conscient (saber què s’indexa i què es deixa fora, i per què), degradació mesurada (instrumentar la pèrdua de qualitat com a mètrica operativa, no com a intuïció), i complementarietat honesta (reconèixer que el RAG completa però no substitueix la memòria viva).

Preguntes obertes

  • Si un RAG respon amb confiança sobre el que sap però calla sobre el que no està indexat, en quin moment la seva completitud aparent es converteix en desinformació estructural?
  • Pot una organització afirmar que “ha resolt la seva memòria” quan la major part del que sap —el coneixement tàcit— segueix vivint només en les persones que se n’estan anant?
  • Quan l’índex premia per defecte els documents antics per la seva major densitat històrica, quina versió de l’organització estem consultant: l’actual, o la que va ser?

Les preguntes no tenen resposta tancada. Però convé una idea final: l’entropia del coneixement corporatiu no s’ha eliminat amb el RAG — s’ha desplaçat. Abans vivia en la rotació de persones, en els documents que ningú trobava, en l’oblit natural de les pràctiques. Ara viu en el drift dels embeddings, en els índexs sense reconciliar, en la il·lusió que el vectoritzable és tot el que se sap. La forma ha canviat. L’entropia segueix.

I aquesta entropia, avui, la sosté qui construeix el pipeline. Amb instrumentació, amb consciència del que queda fora, amb humilitat sobre el que la màquina pot i no pot recordar.

Referències

  • Openlayer — What are embedding models? A complete guide (març 2026). Drift, retrieval accuracy regression. openlayer.com
  • Leela Desai (Medium) — Knowledge Drift: The Silent AI Killer in RAG models (febrer 2025). medium.com
  • AI with Aish — All you need to know about RAG (in 2026) (març 2026). Exemple Q3 2025 vs 2024. substack.com
  • Oracle Developers — How to Detect RAG Index Drift (juliol 2026). Reconciliació índex/font. blogs.oracle.com
  • arXiv — Retrieval-Augmented Generation: A Survey (2024). Semantic drift en multi-hop retrieval. arxiv.org/pdf/2407.13193
  • Wikipedia — Corporate amnesia. Coneixement tàcit vs. explícit. wikipedia.org
  • Articles anteriors d’aquesta sèrie: Infraestructures que obliden, L’oblit a les màquines.