B2Shift · Pubblicato il 27 agosto 2026 · Aggiornato il 27 agosto 2026
La generazione aumentata di recupero (RAG) consente a un sistema di rispondere dai tuoi documenti anziché dai dati di addestramento generali di un modello, con una citazione della fonte. L'idea è semplice; la variazione dei costi nella pratica deriva da un numero limitato di decisioni prese in anticipo.
Cosa fa effettivamente una pipeline RAG
I documenti vengono suddivisi in blocchi, convertiti in incorporamenti vettoriali e archiviati in un database vettoriale. Una domanda viene incorporata nello stesso modo, vengono recuperati i blocchi che corrispondono più strettamente e il modello risponde utilizzando solo quei blocchi come contesto, con una citazione al documento di origine. Rimuovi il passaggio della citazione e avrai un sistema che nessuno può verificare quando è sbagliato.
Ciò che determina il costo più della scelta del modello
Quattro cose spostano il numero più del modello linguistico scelto. Volume e formato del documento: i PDF scansionati necessitano dell'OCR prima di poter essere suddivisi in blocchi e gli errori OCR si propagano in ogni risposta a valle. Strategia di suddivisione in blocchi: l'ingenua suddivisione in suddivisioni a lunghezza fissa è economica da realizzare e spesso sbagliata su documenti strutturati come contratti o tabelle. Qualità del recupero: un database vettoriale ha un'infrastruttura reale e costi di query su larga scala che necessitano di ottimizzazione, non solo di installazione. E valutazione: senza una serie di test di domande reali e risposte notoriamente corrette, non puoi dire se il sistema è accurato: puoi solo dire se sembra sicuro, il che è una cosa completamente diversa.
Dove la precisione effettivamente si rompe
I documenti di origine di scarsa qualità sono il fallimento più comune, non le limitazioni del modello: un sistema RAG non può rispondere correttamente da un documento che è esso stesso sbagliato o ambiguo. Tabelle, grafia scansionata e layout a più colonne necessitano di una gestione speciale; l'estrazione ingenua li lascia cadere o li rimescola silenziosamente. E il recupero con riconoscimento delle autorizzazioni è importante tanto quanto l'accuratezza: un sistema in grado di recuperare un documento che un utente non dovrebbe vedere è un bug di sicurezza, non un bug di precisione.
Cosa include una costruzione realistica
Una pipeline RAG di produzione necessita di una soglia di confidenza definita al di sotto della quale il sistema dice "Non ho una risposta affidabile" invece di tirare a indovinare, una coda di revisione per i casi con scarsa confidenza e un report di accuratezza misurato rispetto al proprio set di test, non un benchmark generico, perché i tuoi documenti non sono i documenti del benchmark. Consulta Automazione dei documenti e RAG per informazioni su come analizziamo questo problema.