Che cos’è il RAG as a Service?
RAG as a Service (RAGaaS) è un’offerta gestita che si occupa dell’infrastruttura alla base della Retrieval-Augmented Generation (RAG). La tecnologia RAG integra un modello di intelligenza artificiale con le conoscenze specifiche di un’organizzazione, in modo che le risposte attingano a dati aziendali aggiornati e pertinenti. Con RAGaaS, un fornitore gestisce i livelli di acquisizione, archiviazione e recupero dei dati, mentre i team collegano i propri contenuti e sviluppano applicazioni basate su tale infrastruttura.
La maggior parte delle soluzioni RAGaaS condivide un nucleo comune: l’acquisizione dei documenti, l’incorporamento e l’archiviazione vettoriale, un livello di recupero e un’interfaccia per trasmettere il contesto recuperato a un modello linguistico. Al di là di questo nucleo, le soluzioni differiscono per i tipi di dati supportati, le tecniche di recupero e il grado di automazione.
Amazon Bedrock Knowledge Bases è un esempio di RAGaaS. Si tratta di un servizio gestito in cui AWS si occupa dell'acquisizione, dell'archiviazione, degli embedding, del re-ranking, dell'ottimizzazione del recupero e del ridimensionamento.
Come funziona RAG as a Service?
RAGaaS prevede le stesse fasi di qualsiasi sistema RAG. Il contenuto viene acquisito e suddiviso in blocchi, convertito in embedding e archiviato in un indice vettoriale. Quando un utente pone una domanda, il servizio cerca nell’indice i passaggi più pertinenti e li restituisce come contesto che il modello utilizzerà nella sua risposta.
Il provider gestisce le prestazioni relative al ridimensionamento, all’indicizzazione e al recupero dei dati tramite un’API. Gli sviluppatori inviano documenti ed eseguono query per estrarre informazioni, mentre il servizio si occupa di gestire l’intero flusso di elaborazione.
Quali funzionalità offre una piattaforma RAGaaS?
Tra le funzionalità comuni figurano:
- Acquisizione gestita di documenti, immagini e altri tipi di file
- Generazione automatizzata di chunk e embedding
- Gestione dell'archiviazione e dell'indicizzazione dei vettori
- Ricerca semantica e riorganizzazione dei risultati per migliorare la qualità del recupero
- Il "chunking" intelligente, che prepara i documenti per un recupero più accurato
- Controlli di accesso e monitoraggio per uso aziendale
Anche la connettività dei dati è importante. Le conoscenze aziendali sono distribuite tra applicazioni, database, file system e API, pertanto l’integrazione di tali contenuti nella base di conoscenza rappresenta un elemento fondamentale di qualsiasi configurazione RAGaaS.
Perché il RAGaaS è importante?
Realizzare un sistema RAG in-house comporta l’assemblaggio e la manutenzione di pipeline di dati, processi di elaborazione dei documenti, archivi vettoriali e infrastrutture di recupero. Si tratta di un impegno notevole prima ancora che si manifesti qualsiasi valore aziendale. Il RAGaaS accorcia il percorso dai dati grezzi alle risposte basate sull’intelligenza artificiale, consentendo ai team di dedicare il proprio tempo alle applicazioni e ai casi d’uso.
RAGaaS trasferisce questi livelli a un servizio gestito. Con Amazon Bedrock Knowledge Bases, ad esempio, AWS gestisce l’acquisizione, l’archiviazione, gli embedding, il re-ranking, l’ottimizzazione del recupero e il ridimensionamento. Il team mantiene il controllo sulle fonti di dati e sull’applicazione, mentre il fornitore si occupa dell’infrastruttura di recupero sottostante. Il compromesso consiste in una minore personalizzazione a basso livello in cambio di una configurazione più rapida e di minori costi operativi.
RAGaaS e RAG tradizionale: qual è la differenza?
Il RAG tradizionale implica la creazione e la gestione autonoma di ogni singolo livello: acquisizione dei contenuti, preparazione per il recupero, archiviazione, estrazione del contesto pertinente e inserimento di tale contesto in un modello. Il team è responsabile dell’infrastruttura, della messa a punto e del ridimensionamento.
RAGaaS trasferisce tali livelli a un servizio gestito. Il team mantiene il controllo delle fonti di dati e dell’applicazione, mentre il fornitore si occupa dell’infrastruttura di recupero sottostante. Il compromesso consiste in una minore personalizzazione a basso livello in cambio di una configurazione più rapida e di minori costi operativi.
Domande frequenti (FAQ)
RAGaaS è l'acronimo di "Retrieval-Augmented Generation as a Service". Si tratta di un servizio gestito che gestisce l'infrastruttura di recupero alla base della tecnologia RAG.
I modelli linguistici conoscono solo ciò su cui sono stati addestrati. RAGaaS consente loro di accedere a informazioni aggiornate e specifiche dell'organizzazione, eliminando la necessità di creare e gestire internamente un'infrastruttura per l'acquisizione, l'archiviazione e il recupero dei dati.
No. Il fine-tuning modifica il comportamento di un modello, mentre il RAG fornisce al modello le informazioni al momento della query. Molti team utilizzano il RAG per le conoscenze che cambiano spesso e il fine-tuning per lo stile o per compiti specifici.
La maggior parte dei servizi supporta documenti quali PDF, file Word e pagine web. Alcuni gestiscono anche immagini e altri contenuti multimediali. I dati strutturati provenienti da database e applicazioni devono solitamente essere estratti e preparati prima dell'acquisizione.
Il modello formula le risposte attingendo dai brani delle fonti recuperate, quindi le risposte sono basate su contenuti reali. Molti servizi forniscono anche i riferimenti bibliografici, consentendo agli utenti di verificare la provenienza di una risposta.
La sicurezza dipende dal fornitore. Verificate che siano presenti la crittografia sia in transito che in fase di archiviazione, controlli di accesso che rispettino le autorizzazioni esistenti, opzioni relative alla localizzazione dei dati e politiche chiare riguardo all’eventuale utilizzo dei vostri contenuti per l’addestramento dei modelli.
L'implementazione interna di RAG è indicata quando un team necessita del pieno controllo sulla suddivisione in blocchi, sui modelli di embedding o sulla logica di recupero, oppure ha requisiti rigorosi riguardo al luogo in cui i dati possono essere elaborati. I team che non presentano tali esigenze spesso raggiungono la fase di produzione più rapidamente ricorrendo a un servizio gestito.
RAG agentico consente a un agente IA di pianificare il proprio processo di recupero delle informazioni. Scompone una domanda complessa in sotto-query, esegue il recupero in modo iterativo e combina i risultati in un’unica risposta. Amazon Bedrock Knowledge Bases supporta questa funzionalità grazie alla sua capacità di recupero agentico.



