FIX
← Segnali
Data & AI

LLM per data analysis eCommerce: parlare ai dati in linguaggio naturale

Come costruire un layer text-to-SQL sicuro sopra un data warehouse eCommerce (Magento, Shopify, Klaviyo, GA4) in modo che marketing e founder facciano domande in italiano e ottengano risposte affidabili.

10 Giu 2026 · 10 min · Alberto Sepe

Text-to-SQL per eCommerce è un'interfaccia AI che traduce domande in linguaggio naturale ('quanto ho venduto la scorsa settimana rispetto all'anno scorso, escluso il black friday?') in query SQL sul data warehouse, esegue e restituisce la risposta con grafico. Sostituisce il 70% delle richieste 'per favore, un report' che oggi saturano il team dati.

Stack che usiamo: warehouse su BigQuery o Postgres, un layer semantico (Cube.js o dbt metrics) che espone metriche pre-aggregate e vincoli di sicurezza, un LLM (Claude o GPT-4o) che genera SQL solo contro le view autorizzate, un executor con timeout duro e row limit, un renderer che sceglie tabella o grafico.

Il layer semantico è il pezzo che rende tutto sicuro e affidabile. Senza, l'LLM genera JOIN sbagliati fra tabelle raw e restituisce numeri plausibili ma falsi. Con un modello semantico, l'AI compone metriche già validate: 'revenue', 'orders', 'AOV', 'active customers' hanno una sola definizione.

Sicurezza: read-only DB user, whitelist di schemi, prompt injection filter, log completo di ogni query e chi l'ha chiesta. Mai lasciare che l'LLM esegua DDL o modifichi dati. Row-level security per team: marketing vede tutto tranne i costi merce, finance vede i margini, un ruolo 'client' vede solo la sua brand se il warehouse è multi-tenant.

Il game-changer per gli eCommerce è la capacità di correlare fonti diverse in una singola domanda: 'Quali categorie hanno il miglior ROAS ADS negli ultimi 30 giorni e la peggiore retention a 90 giorni?' L'AI compone JOIN fra dati Magento, GA4 e Meta Ads senza che nessuno debba disegnare il report.

Setup tipo su un cliente da 15M€/anno: 3 settimane di implementazione, ~1.200 query/mese generate, riduzione richieste ad-hoc al team dati del 68%. Costo LLM ~180€/mese. ROI molto sotto i 3 mesi.

Cosa cambia per il team commerciale e marketing

L'impatto organizzativo più visibile non è sui data analyst — è sul team marketing e sui founder. Quando un CMO può chiedere alle 22 di sera 'quali campagne meta hanno CAC sopra i 40€ negli ultimi 14 giorni' e avere risposta in 8 secondi, il ritmo delle decisioni cambia. Sparisce la coda 'aspetto martedì il report'. I meeting settimanali diventano molto più corti perché tutti arrivano con i dati già visti in autonomia.

Limiti reali (dove ancora fallisce)

Il text-to-SQL non funziona bene su domande che richiedono giudizio di business ('quali prodotti dovremmo togliere dal catalogo?'), su analisi che richiedono correlazioni statistiche non banali (cohort retention curves con adjustment per stagionalità), e su domande formulate in modo troppo ambiguo ('come vanno le vendite?' — quale metrica? Su quale periodo? Rispetto a cosa?). Su questi casi l'agente dovrebbe chiedere chiarimenti — se non lo fa, inventa e fa danni. Un buon prompt di sistema forza clarification prima di generare SQL su richieste vaghe.

Roadmap tipica dei primi 90 giorni

Settimana 1–2: audit del warehouse e definizione delle prime 15 metriche core nel layer semantico. Settimana 3–4: agente text-to-SQL contro le viste sicure, testing interno con 5–10 utenti. Settimana 5–8: rollout a marketing e commerciale, feedback loop per raffinare prompt e sinonimi (ogni cliente ha un vocabolario diverso — 'clienti attivi', 'buyer', 'customers' possono significare cose diverse). Settimana 9–12: monitoraggio uso reale, aggiunta di nuove metriche in base alle domande più frequenti, integrazione in Slack per query on-the-fly.

Vuoi parlarne con noi?

Ogni segnale nasce da un progetto reale.

Scrivici →