Amplifa – Piattaforma di vendita IA per il B2B industriale

AI nelle vendite: Llama, Mistral, Qwen a confronto

KI & Automatisierung · 5. Oktober 2026 · Ohiku Mose Guy

AI nelle vendite: Confronto tra Llama, Mistral, Qwen e modelli API per le pipeline di vendita nelle PMI – con costi, latenza e criteri.

Cloudflare Clef impiega 2,2 secondi per una classificazione, secondo un recente rapporto; GPT-OSS-120B è indicato con 4,7 secondi, sebbene l'affidabilità del benchmark stesso sia messa in discussione (Fonte: rapporto Cloudflare-Clef, Riferimento [15], consultato il 5 ottobre 2026). Questo numero è piccolo. Ed è pericoloso. Perché in una riunione di vendita suona immediatamente come agente telefonico, dialogo in tempo reale e "l'AI nelle vendite ora può fare tutto", anche se una classificazione non è la stessa cosa di un flusso di conversazione pulito con azione CRM, consenso, interruzione e protocollo.

È esattamente per questo che questo confronto è necessario. Negli ultimi 7-14 giorni, secondo i risultati disponibili, non c'è stata alcuna ondata di pubblicazioni ufficiali affidabili su nuovi modelli Llama o Mistral che combinassero in modo pulito prezzi, latenze, finestre di contesto e benchmark indipendenti. Ollama 0.40.0 è stato rilasciato il 5 ottobre 2026, sì, ma il risultato disponibile non fornisce informazioni affidabili su nuove versioni di modelli, prezzi dei token o latenze di inferenza (Fonte: AIML UpToDate Releases [1]). Beh, quasi. Ci sono singole misurazioni di terze parti, ad esempio Mistral Small 4 119B con circa 56,6 GiB di peso FP8 e circa 49 token al secondo su una configurazione GB10, ma questo non è un benchmark ufficiale di Mistral e non è una promessa API cloud.

Scrivo questo come ingegnere presso Amplifa, non come analista con una bella matrice. La mia quotidianità è meno "quale modello vince su MMLU?" e più: perché il job RAG si blocca alle 03:17 su una tabella PDF di Phoenix Contact? Perché un team di vendita di Kärcher ha improvvisamente il 18% in più di rilavorazioni manuali, anche se i testi delle email suonano meglio? Perché un'inferenza locale dopo tre settimane di pilot non costa la metà, ma il doppio, perché nessuno ha calcolato l'utilizzo della GPU, gli embeddings, il reranking e la logica di retry?

La domanda per un responsabile delle vendite in una PMI non è: "Llama è migliore di Mistral?" La domanda migliore è: quale famiglia di modelli si rompe per prima in quale punto della mia pipeline di vendita? La ricerca di lead si rompe in modo diverso dalla personalizzazione delle email. Le chiamate vocali si rompono in modo diverso dal RAG per la conoscenza del prodotto. E un CEO di Heilbronn che vende macchine per linee di imballaggio non ha bisogno di una religione del modello. Ha bisogno di pipeline, controllabilità e una curva dei costi che non esploda nel secondo trimestre.

AI nelle vendite – Criteri di valutazione per i rilasci dei modelli

Qui non valuto Llama, Mistral, Qwen e i modelli API proprietari in base al fan club. Li valuto in base al comportamento in produzione. Sembra noioso. E lo è. Ma è proprio lì che si decide se un progetto pilota presso DMG Mori, Trumpf o un campione nascosto della Vestfalia orientale riceverà un budget dopo sei settimane o finirà nella cartella delle innovazioni.

Per le vendite B2B, a mio avviso, contano questi criteri:

  • Profilo di latenza anziché velocità media: Time-to-First-Token, throughput di decodifica, latenza di coda e comportamento di streaming sono più importanti per voce e chat di un bel numero di token al secondo.
  • Finestra di contesto e costi di prefill: Lunghe cronologie CRM, gare d'appalto, schede tecniche di prodotti e thread di email costano soprattutto nel prefill. Una grande finestra di contesto senza controllo dei costi è un rubinetto aperto.
  • Accuratezza fattuale con fonti: Per la ricerca di lead e il RAG, conta se il modello estrae correttamente i dati aziendali, cita le fonti e si rifiuta in assenza di prove. Non se scrive un paragrafo elegante.
  • Uso degli strumenti e output strutturato: Le azioni CRM, gli schemi JSON, le regole di validazione, le strategie di retry e le autorizzazioni decidono in produzione più della qualità linguistica generale.
  • Modello di deployment: I pesi aperti localmente con vLLM, Ollama o TGI sono diversi da un'API di OpenAI, Anthropic, Mistral o un fornitore di cloud. La protezione dei dati non è una questione da spuntare.
  • Costo per oggetto di vendita: Preferisco calcolare i costi per 1.000 lead, per email approvata e per minuto di conversazione piuttosto che i costi per milione di token, perché le vendite non comprano token, ma opportunità.
  • Governance e auditabilità: Diritti di ruolo, separazione dei tenant, protezione dalle prompt injection, logging, concetti di cancellazione e processi di approvazione non sono sexy. Vero. Senza di essi, nulla scala.

Andrea, Head of Sales presso un fornitore di automazione a Bielefeld, mi ha detto una frase nel settembre 2026 che mi è rimasta impressa: "Se l'AI scrive un riferimento sbagliato in un'email, non è l'AI a fare una brutta figura. Sono io." È proprio qui la differenza tra una demo e un sistema di vendita. Una demo può brillare. Un sistema di vendita deve comportarsi bene.

Se l'AI scrive un riferimento sbagliato in un'email, non è l'AI a fare una brutta figura. Sono io.

— Andrea, Head of Sales presso un fornitore di automazione a Bielefeld

Candidato 1 – Llama per l'AI nelle vendite

Llama rimane il punto di partenza ovvio per molti team di vendita di PMI, quando contano il controllo locale, un ampio ecosistema e molte opzioni di inferenza. Pesi aperti, molte quantizzazioni, ampio supporto di strumenti, funzionamento tramite vLLM, TGI, Ollama o fornitori di cloud. Questa è la forza. Non necessariamente il singolo modello. L'ecosistema.

Per un responsabile delle vendite, ciò significa: Llama è interessante se l'IT interno o un fornitore di servizi è già in grado di gestire le GPU, se i dati non devono andare a un'API esterna o se sono in esecuzione molti piccoli lavori di classificazione ed estrazione. Esempio: un team estrae nomi di aziende, ruoli, sedi, indicazioni di fatturato e segnali di acquisto da siti web, PDF e dati del registro delle imprese. Per questo non ho bisogno di un modello il più grande possibile, ma di un'estrazione stabile, un output deterministico, costi bassi e buoni messaggi di errore. Presso un cliente con una struttura di fornitura simile a Schaeffler, nella primavera del 2026 abbiamo visto che un modello locale più piccolo con uno schema rigoroso era più affidabile di un modello più grande senza convalida. Sembra banale. Ma ha fatto la differenza tra il 7% e il 23% di rilavorazioni nella verifica dei dati.

La debolezza di Llama raramente si manifesta nel primo test. La debolezza sta nell'operatività. Chi dice "open source" e intende "gratuito" non ha visto il conto. Affitto o ammortamento della GPU, elettricità, archiviazione, monitoraggio, aggiornamenti del modello, versioning dei prompt, controlli di sicurezza, embeddings, reranking, percorsi di backup in caso di sovraccarico, crawl notturni con PDF rotti del 2017. Questo non sa di laboratorio di ricerca, ma di sala server calda e archivi di documenti impolverati. Ed è proprio lì che si decide se l'inferenza locale è più economica.

Per la personalizzazione delle email, Llama può funzionare bene se il valore effettivo deriva dal retrieval e dalle guardrail. Il modello non deve fare ricerche libere. Deve scrivere da fonti approvate: nota CRM, ultima richiesta, interesse per il prodotto, settore, ruolo, riferimenti consentiti. Mi piace Llama in tali configurazioni perché si può controllare molto. Mi fido meno di Llama se qualcuno vuole costruire un agente di vendita autonomo senza valutazione, che seleziona i contatti, formula le email, pianifica i follow-up e sovrascrive i campi CRM. Chi lo avvia senza approvazione umana non costruisce una vendita. Costruisce un moltiplicatore di danni.

Candidato 2 – Mistral per stack di vendita europei

Mistral è interessante per le aziende europee per una semplice ragione: approvvigionamento, localizzazione dei dati, percezione del fornitore e varianti di modelli compatti spesso si adattano meglio alla realtà delle PMI rispetto a uno stack puramente incentrato sugli Stati Uniti. Questo non significa automaticamente che Mistral vinca in ogni caso d'uso. Non del tutto. In alcuni flussi di lavoro di vendita, Mistral vince proprio perché non vuole essere il modello più grande in circolazione.

L'attuale test di terze parti su Mistral Small 4 119B menziona circa 56,6 GiB di peso FP8 locale e circa 49 token al secondo su una configurazione GB10 descritta (Riferimento [10]). Non venderei mai questo numero come latenza cloud generale. Non dice quanto è alto il Time-to-First-Token in un'API. Non dice come si comporta il modello con 30 utenti paralleli. Non dice nemmeno quanto siano stabili le chiamate agli strumenti in un processo CRM. Ma mostra qualcosa di importante per i responsabili delle vendite: i modelli compatti e quantizzati possono diventare sufficientemente economici per compiti specifici, purché il processo intorno a essi sia costruito correttamente.

Nella stesura di email, traduzione, adattamento del tono e riepilogo di contatti precedenti, Mistral può essere forte. Lo esaminerei in particolare se i contenuti tedeschi e francesi si presentano mescolati, ad esempio presso costruttori di macchine con vendite in DACH e Francia o presso fornitori in regioni di confine. Webasto, Brose, Festo, Wittenstein – queste aziende non vivono in un mondo SaaS puramente inglese. Termini di prodotto, ruoli, forma giuridica, filiali e vecchie note CRM sono multilingue e disordinati. Un modello deve gestirli senza trasformare "richiesta pezzo di ricambio guarnizione" in un'opportunità di trasformazione strategica (sì, l'ho visto).

La debolezza: anche per Mistral vale che i modelli open-weight non sono automaticamente software open source nel senso stretto del termine. Licenza, uso commerciale, riproducibilità, trasparenza dei dati di training e modello di hosting devono essere letti separatamente. "Open" può significare: pesi disponibili. Non può significare: libero da restrizioni, auditabile fino al training, utilizzabile commercialmente a piacimento. Per un CSO, questa distinzione non è accademica. Se il reparto legale a dicembre 2026 chiede perché i dati dei clienti sono passati attraverso una certa pipeline, uno screenshot di un thread di benchmark non aiuterà.

Candidato 3 – Qwen per contesti ampi e compromessi difficili

Qwen rientra in questo confronto perché è da tempo presente nei team tecnici, anche se nelle riunioni dei consigli di amministrazione tedeschi viene menzionato meno spesso di Llama o Mistral. L'attuale confronto hardware indica per Qwen3-235B-A22B in NVFP4 circa 24 token al secondo sull'hardware testato (Riferimento [10]). Questa non è una classifica standardizzata. Ma mostra il compromesso: modello grande, quantizzazione diversa, maggiore fabbisogno di memoria, throughput diverso. Per le vendite, ciò significa: Qwen può essere interessante se contano l'estrazione complessa, i documenti lunghi o i compiti multilingue. Ma chi non ha una solida base MLOps si soffocherà con le dimensioni del modello, l'operatività e la governance.

Non userei Qwen come primo riflesso nelle PMI. Non perché sia cattivo. Ma perché l'organizzazione spesso non ha nemmeno una corretta versioning dei documenti, igiene CRM e set di valutazione. Presso un costruttore di impianti di Augusta, la sala progetti nel giugno 2026 odorava di stampante laser e canalina per cavi; su SharePoint c'erano listini prezzi con "finale", "finalenuovo" e "finalCopia". In un ambiente del genere, il modello più grande raramente è la soluzione. Prima deve essere chiaro quale file è la verità.

Candidato 4 – Modelli API proprietari per l'automazione delle vendite gestita

I modelli proprietari di OpenAI, Anthropic, Google o fornitori di cloud specializzati rimangono forti nelle vendite perché astraggono l'operatività. Nessun acquisto di GPU. Nessun problema di driver. Spesso migliori API per l'uso degli strumenti, interfacce di streaming più stabili, integrazione più rapida negli stack vocali. Per una PMI che vuole avviare un progetto pilota per l'account intelligence e la stesura di email in 90 giorni, questo è spesso il percorso pragmatico.

Ma sono sospettoso quando qualcuno dice: "Useremo semplicemente il miglior modello API." Il migliore per cosa? Per il primo contatto in tedesco con i responsabili degli acquisti? Per l'estrazione da schede tecniche scansionate? Per la telefonia con interruzione dopo 450 millisecondi? Per l'aggiornamento di Salesforce con i diritti di ruolo? I modelli proprietari sono comodi, ma la curva dei costi può diventare brutta se contesti lunghi vengono inseriti senza filtro in ogni prompt. Un PDF di prodotto di 80 pagine non deve essere inserito ciecamente nel contesto. Deve essere inserito in un sistema di retrieval con chunking, BM25, ricerca vettoriale, reranking, citazioni e versioning.

Nelle chiamate vocali, i modelli API sono spesso in vantaggio, perché la telefonia è una catena: Speech-to-Text, modello di dialogo, connessione agli strumenti, Text-to-Speech, logica di interruzione, protocollo di conversazione, consenso. La latenza end-to-end è cruciale. Non il punteggio MMLU. Non un tempo di classificazione di 2,2 secondi. Per la telefonia naturale, conta quando arriva il primo audio, quanto bene l'agente si ferma in caso di interruzione e se dopo la conversazione imposta davvero lo stato corretto nel CRM. Markus, CSO di un costruttore di macchine di Norimberga, lo ha formulato in modo piuttosto secco nell'agosto 2026: "Se il bot tace per tre secondi, il mio cliente riattacca."

Se il bot tace per tre secondi, il mio cliente riattacca.

— Markus, CSO di un costruttore di macchine di Norimberga

Cosa vediamo concretamente in Amplifa

Cosa vediamo concretamente in Amplifa: Negli ultimi 12 mesi, abbiamo osservato un modello ricorrente nei team di vendita B2B nel settore dell'ingegneria meccanica e del commercio tecnico all'ingrosso. La scelta del modello raramente spiega più della metà del risultato. Nella ricerca di lead, la rilavorazione manuale diminuisce in modo significativo solo quando si verificano tre cose insieme: estrazione delle fonti prima della chiamata al modello, schemi JSON rigidi dopo la chiamata al modello e un set di test con veri casi negativi. In una configurazione con circa 42.000 profili aziendali, un cliente ha ridotto il tempo di verifica manuale per account qualificato da circa 4 minuti a poco meno di 90 secondi. Questo non è dovuto a un modello più grande. È dovuto al fatto che il sistema ha smesso di indovinare in caso di dati mancanti.

Un altro modello: la qualità delle email è sovrastimata nei workshop, la qualità dei dati CRM è sottostimata. Se settore, ruolo, ultimo contatto e interesse per il prodotto sono puliti, un modello di medie dimensioni spesso fornisce bozze utilizzabili. Se questi campi mancano o sono contraddittori, anche un modello di punta allucina cortesemente. Allora l'email suona bene ed è comunque sbagliata. Questa è la variante peggiore, perché passa attraverso le approvazioni.

Un riscontro concreto dalle implementazioni: per il RAG nelle vendite, gli embeddings e il reranking sono spesso le leve segrete. Non il modello di chat. Un approccio ibrido di ricerca vettoriale, BM25 e reranking è menzionato anche nelle attuali panoramiche del settore (Riferimento [13]), ma la pratica è più sporca: i nomi dei prodotti cambiano, le tabelle PDF si rompono, i listini prezzi hanno diritti di tenant e i vecchi materiali di formazione contengono affermazioni che le vendite non possono più fare dal 2024. Se un modello risponde a questo, non è il modello ad aver fallito. L'architettura della conoscenza era difettosa.

Grande confronto – Llama, Mistral, Qwen, modelli API

CandidatoPunti di forza nelle vendite B2BDebolezze in produzioneClassificazione tecnicaCasi d'uso tipici nelle vendite
Llama / Ecosistema Open-WeightAmpio supporto di strumenti, deployment locale, molte quantizzazioni, buon controllo sui flussi di datiSforzo operativo, verifica delle licenze, utilizzo della GPU, valutazione e aggiornamenti spesso sottostimatiNessuna nuova ondata di rilascio ufficiale verificata con prezzi, latenze e benchmark nel periodo di ricerca; Ollama 0.40.0 del 5 ottobre 2026 senza metriche di modello affidabili nel risultato [1]Ricerca di lead, classificazione, estrazione strutturata, assistenti RAG interni
Mistral / Opzioni di modelli europeiInteressante per l'approvvigionamento vicino all'UE, varianti compatte, testi di vendita multilingue, opzioni di hosting locali o europeeI benchmark di terze parti non sono automaticamente trasferibili; Open-Weight non significa automaticamente completamente apertoMistral Small 4 119B in un test di terze parti con circa 56,6 GiB FP8 e circa 49 token/s su configurazione GB10; nessun benchmark standard ufficiale [10]Bozze di email, traduzione, RAG con conoscenza del prodotto, Account Intelligence
Qwen / Grandi modelli Open-WeightForte per l'estrazione complessa e i compiti multilingue, tecnicamente interessante per team con maturità MLOpsGrande fabbisogno di memoria, operatività impegnativa, questioni di governance e percorsi di approvvigionamento meno familiari nelle PMIQwen3-235B-A22B in NVFP4 secondo test di terze parti a circa 24 token/s sull'hardware testato; non leggibile come latenza API generale [10]Analisi di documenti, contesti lunghi, classificazione impegnativa, pipeline di ricerca
Modelli API proprietariIntegrazione rapida, operazioni gestite, spesso forti capacità di uso degli strumenti e di streaming, buona idoneità per stack vocaliCosti dipendenti dall'uso, elaborazione dei dati presso il fornitore, vendor lock-in, contesti lunghi possono diventare costosiI prezzi dei token e le finestre di contesto devono essere verificati per listino prezzi del fornitore alla data di riferimento; la ricerca attuale non fornisce una nuova base di prezzi uniforme per ottobre 2026Chiamate vocali, Sales Copilot, generazione di email, flussi di lavoro CRM con chiamate a strumenti
Modelli specializzati più piccoliEconomici, controllabili, buoni per classificazione, routing, estrazione e pre-filtraggioQualità linguistica limitata per testi complessi, richiedono compiti chiari e buona validazioneSpesso più economici dei modelli di punta se RAG, schemi e routing sono corretti; i valori di benchmark devono essere misurati internamenteClassificazione ICP, Lead Scoring, verifica duplicati, riconoscimento intenti

Non leggerei questa tabella come una classifica. Le classifiche sono comode. Purtroppo rendono pigri. Per i sistemi di vendita, l'architettura migliore è spesso un router: modello piccolo per la classificazione, retrieval per la conoscenza, modello più potente per la bozza finale, regole per la conformità, umano per l'approvazione in caso di alto rischio. Un modello per tutto è raramente architettura. Di solito è stanchezza di budget.

Per chi è adatta quale soluzione? Llama si adatta a team con forte IT locale e pressione sulla protezione dei dati. Mistral si adatta a stack di vendita europei con flussi di lavoro multilingue. Qwen si adatta a team tecnicamente maturi con grandi compiti documentali. Le API proprietarie si adattano a piloti rapidi, agenti vocali e uso di strumenti, se le questioni relative ai dati e ai costi sono chiarite. I modelli più piccoli si adattano quasi sempre come pre-filtro.

Confronto prezzi – I prezzi dei token non sono tutta la verità

I risultati di ricerca attuali non forniscono prezzi ufficiali verificati dei token per i nuovi modelli Llama o Mistral nel periodo fino al 5 ottobre 2026. Pertanto, non indicherò prezzi fantastici per milione di token. Sarebbe poco serio. Soprattutto nelle vendite, dove un calcolo errato si rende visibile in seguito in 300.000 email generate o 50.000 minuti di conversazione.

Per i modelli auto-ospitati, non esiste comunque un prezzo uniforme per token. I costi effettivi si calcolano approssimativamente come: Costo per 1 milione di token = Costi di GPU, elettricità, archiviazione e operativi per ora diviso per i token elaborati per ora, moltiplicato per 1.000.000. Sembra pulito. Lo è solo a metà. Il throughput di prefill per contesti CRM lunghi e il throughput di decodifica per chat o telefonia devono essere considerati separatamente. La dimensione del batch, la quantizzazione, l'utilizzo e la latenza di coda modificano il calcolo più di quanto molti modelli Excel ammettano.

Blocco di costoOpen-Weight localeModello APIRischio per i team di venditaLa mia domanda di verifica
Token / InferenzaNessun prezzo ufficiale per token; costi dipendenti da GPU, utilizzo, quantizzazione e operativitàPrezzo per token di input/output secondo il listino prezzi del fornitore; verificare per i nuovi rilasci alla data di riferimentoPrompt lunghi con dati CRM e RAG aumentano i costi inosservatiQuanti token costa davvero un lead qualificato?
EmbeddingsModello proprio o servizio locale, più costi operativiPrezzo API separato possibileIl RAG diventa costoso se ogni modifica del documento viene re-embedded ciecamenteCome versioniamo i dati di prodotto e i listini prezzi?
RerankingInferenza locale aggiuntiva o servizio specializzatoCosti API aggiuntivi e latenzaSenza reranking aumentano le fonti errate; con reranking aumenta la latenzaQuale fedeltà di risposta ci serve per le approvazioni di vendita?
Speech-to-Text / Text-to-SpeechModelli propri possibili, ma operatività complessaDi solito basato sull'uso per minuto o carattereI costi vocali sono spesso budgetizzati separatamente dall'LLM e poi dimenticatiQuanto costa un minuto di conversazione di successo end-to-end?
MLOps / MonitoraggioResponsabilità propria per log, drift, sicurezza, aggiornamentiParzialmente assunto dal fornitore, ma l'audit rimane internoGli errori diventano visibili solo quando le vendite lavorano già con dati sbagliatiChi vede le allucinazioni prima che le veda il cliente?

Un confronto dei prezzi senza dati di processo è teatro. Preferisco calcolare con unità che un CSO capisce: costi per 1.000 account arricchiti, costi per email approvata, costi per appuntamento prenotato, costi per minuto di conversazione con risultato valido. Presso un fornitore di Festo con 12 venditori, il collo di bottiglia non è lo stesso di un team SaaS con 80 SDR. Quindi il calcolo del modello non deve essere lo stesso.

Prodotto Amplifa – Sistemi di vendita AI per B2B Come Amplifa collega la ricerca di lead, l'account intelligence, la personalizzazione delle email e l'automazione delle vendite con pipeline AI controllate.

RAG per la conoscenza delle vendite – perché il modello raramente è sufficiente

Uno stack RAG adatto alle PMI per le vendite deve fare di più che gettare documenti in un database vettoriale. Deve versionare dati di prodotto, listini prezzi, documentazione tecnica e vecchi materiali di formazione. Deve conoscere le autorizzazioni a livello di documento e di tenant. Deve fornire fonti e posizioni delle pagine. Deve riconoscere i contenuti obsoleti. Deve rifiutare in assenza di prove.

Sembra molta infrastruttura per alcune bozze di email. Ma non lo è. Le vendite vivono di promesse. Se un Account Executive dice a un acquirente di Trumpf o a un fornitore di Stoccarda una compatibilità sbagliata, un tempo di consegna sbagliato o un riferimento sbagliato, il danno non è astratto. Allora qualcuno chiama. Con la voce. Di solito non amichevolmente.

La mia ferma opinione: per le vendite, un modello più piccolo con un buon RAG e una rigorosa validazione dell'output è quasi sempre migliore di un modello molto grande senza controllo delle fonti. Non a volte. Quasi sempre. L'eccezione sono compiti creativi molto liberi, ma questi sono sovrastimati nell'outbound B2B. La maggior parte dei buoni testi di vendita non sono creativi. Sono corretti, pertinenti e abbastanza brevi da non infastidire.

Personalizzazione delle email – quali benchmark non misurano

BLEU, MMLU, classifiche Arena, valutazioni linguistiche generali – carino. Per le bozze di email B2B, spesso non misurano il problema. A me interessano altri valori: correttezza fattuale dei dati aziendali, riferimenti inventati per 100 email, tasso di approvazione da parte delle vendite, tempo di elaborazione, tasso di risposta, tasso di prenotazione appuntamenti nel test A/B e reclami per indirizzo errato.

Nel marzo 2026, presso un rivenditore tecnico con filiali a Colonia e Ulm, abbiamo visto un test che inizialmente sembrava frustrante internamente. Il modello più grande scriveva email più belle. Il modello più piccolo otteneva più approvazioni. Perché? Rimaneva più vicino al materiale, usava meno formulazioni libere e si atteneva all'elenco di riferimento. Le vendite apprezzavano meno i testi. I clienti reagivano meglio. Onestamente? Non lo so per ogni caso. Ma mi fido più delle metriche provenienti da veri test di invio che di una giuria che legge le risposte ai prompt.

Chiamate vocali – perché 2,2 secondi non sono un agente telefonico

I 2,2 secondi del rapporto Cloudflare-Clef si riferiscono alla classificazione. Per le chiamate vocali, questo è al massimo un componente. Un agente vocale ha bisogno di Speech-to-Text, un modello di dialogo, connessione a strumenti e CRM, Text-to-Speech, logica di interruzione, escalation, registrazione e meccanismi di consenso. Se un anello di questa catena è lento, la conversazione suona rotta.

  1. Misura prima il Time-to-First-Audio anziché solo i token al secondo. Il cliente non sente una velocità di token, sente il silenzio.
  2. Testa le interruzioni con frasi reali: "Un momento", "No, non è vero", "Me lo mandi via email". Molte demo si bloccano proprio lì.
  3. Verifica le chiamate agli strumenti sotto carico: contatto trovato, opt-out riconosciuto, risultato della conversazione scritto, follow-up non duplicato.
  4. Misura la Tail-Latency, non solo la media. Un agente che è veloce nel 95% dei casi e si blocca nel 5% è rischioso nelle vendite.
  5. Costruisci l'escalation. Se l'incertezza è alta, l'agente deve passare pulitamente a un essere umano o interrompere.

Per la voce, nel 2026, inizierei piuttosto con API proprietarie o stack specializzati, se il team non può gestire l'inferenza in tempo reale in proprio. I modelli open-weight locali possono funzionare, ma allora parliamo di streaming, latenze audio, prenotazione GPU, picchi di carico e osservabilità. Questo non è un progetto secondario per lo studente lavoratore, anche se LinkedIn promette il contrario.

FAQ – Qual è il modello migliore per l'AI nelle vendite?

Il modello migliore per l'AI nelle vendite non esiste come risposta generale. Per la classificazione dei lead, un piccolo modello locale può essere sufficiente. Per le bozze di email, Mistral o Llama con un buon RAG possono essere forti. Per le chiamate vocali, le API gestite sono spesso più pragmatiche. Per l'analisi complessa dei documenti, Qwen può diventare interessante se l'operatività e la governance sono corrette. Chi cerca una singola risposta non ha ancora posto la domanda sull'architettura.

Raccomandazione personale – il mio ordine per le PMI

Quando inizio in un'azienda B2B di medie dimensioni, non inizio con il modello più grande. Inizio con un taglio di processo. Quali dati entrano? Quale decisione deve essere presa? Quale output può avvenire automaticamente? Quale output richiede approvazione? Quali errori sono imbarazzanti, quali costosi, quali legalmente pericolosi? Solo dopo scelgo la famiglia di modelli e il deployment.

Il mio ordine per la maggior parte dei progetti pilota di vendita: prima costruire la pipeline di dati e fonti. Poi testare un modello piccolo o medio per la classificazione e l'estrazione. Poi RAG con obbligo di fonti. Poi bozze di email con approvazione e test A/B. La voce solo quando logging, consenso, azioni CRM ed escalation sono a posto. Chi inizia direttamente con un agente vocale autonomo perché un benchmark sembra veloce, confonde la potenza del motore con lo spazio di frenata.

Con Llama vedo il vantaggio nel controllo e nell'ecosistema. Con Mistral vedo il vantaggio nella connettività europea e nei flussi di lavoro compatti. Con Qwen vedo il potenziale per team tecnicamente forti con carichi documentali. Con le API proprietarie vedo il percorso più veloce per piloti e voce. Non escluderei nessuno di questi percorsi per principio. Ma rifiuterei chiunque inizi senza un set di valutazione, un modello di costi e una governance.

Amplifa Sales Audit – Verifica il potenziale dell'AI nelle vendite Verifica quali processi di vendita sono adatti all'AI, dove mancano i dati e quale automazione ha senso economico.

Aiuto decisionale – 3 domande prima della scelta del modello

  1. Quale compito di vendita deve risolvere realmente il modello: ricerca di lead, stesura di email, RAG, voce o azione CRM? Se la risposta è "tutto", l'ambito è troppo ampio.
  2. Quali errori non devono accadere: dati aziendali errati, riferimenti inventati, affermazioni inammissibili, perdita di dati o azioni CRM duplicate? La risposta determina guardrail e approvazioni.
  3. Come misuriamo il successo nel progetto pilota: costi per 1.000 lead, tasso di approvazione, tasso di risposta, prenotazione appuntamenti, Time-to-First-Audio, tasso di allucinazione o tempo di elaborazione? Senza una metrica obiettivo, ogni modello sembrerà in qualche modo buono.

Queste tre domande sono scomode, perché smitizzano il dibattito sui modelli. Ma è proprio questo ciò di cui hanno bisogno le PMI. Non più magia. Più punti di misurazione.

Piano pilota pratico – 30 giorni invece di religione del modello

Quando un responsabile delle vendite mi chiede come iniziare, di solito abbozzo un progetto pilota di 30 giorni. Non perché 30 giorni siano sempre sufficienti. Ma perché lunghi documenti strategici raramente trovano campi CRM rotti. Un breve progetto pilota con dati reali li trova subito. L'odore della verità a volte è un CSV esportato con 17 modi di scrivere lo stesso settore.

  1. Seleziona da 500 a 2.000 account reali dal CRM e anonimizza i campi sensibili, se necessario.
  2. Definisci un Golden Set con etichette verificate manualmente: settore, ICP-Fit, ruolo, Buying Signal, motivo di esclusione.
  3. Testa due percorsi di modello: una configurazione Open-Weight con Llama o Mistral e un modello API come riferimento.
  4. Misura precisione, recall, allucinazioni, costi per account e tempo di rilavorazione manuale.
  5. Solo dopo, costruisci le bozze di email sui dati verificati, non prima.
  6. Esegui un piccolo test A/B con approvazione umana e confronta il tasso di risposta e di appuntamenti.
  7. Non decidere in base al testo più bello, ma in base a costi, tasso di errore e accettazione delle vendite.

In un progetto pilota con un campione nascosto della regione di Stoccarda, abbiamo discusso esattamente questa sequenza tre settimane fa. Il desiderio iniziale era un copilot che scrivesse immediatamente le email. Dopo aver esaminato i dati, era chiaro: prima dovevano essere puliti i campi del settore, i duplicati e i ruoli dei referenti. Il modello non era il collo di bottiglia. Erano i dati di input. Non è elegante, ma fa risparmiare denaro.

Risorse e strumenti Amplifa Strumenti e audit gratuiti per l'analisi della pipeline, l'automazione delle vendite e l'uso sensato dell'AI nelle vendite B2B.

La mia conclusione sul confronto dei modelli nell'ottobre 2026

Le prove attuali non sono sufficienti per una classifica pulita "Llama contro Mistral contro Qwen contro Proprietario". Chi pubblica comunque una tale classifica vende una sicurezza che non esiste. Negli ultimi 7-14 giorni mancano rilasci ufficiali affidabili per Llama o Mistral con informazioni complete su prezzi, latenze, finestre di contesto e benchmark indipendenti. Ollama 0.40.0 è un'indicazione rilevante, ma non un confronto di modelli affidabile. I numeri di Mistral e Qwen dai test di terze parti sono interessanti, ma dipendenti dall'hardware. Cloudflare Clef mostra velocità nella classificazione, ma non idoneità alla telefonia.

Per le PMI, questo non significa stallo. Al contrario. Significa una logica di acquisto sobria: verificare le schede ufficiali dei modelli, leggere licenze e flussi di dati, eseguire test propri con compiti di vendita anonimizzati, calcolare i costi per oggetto di vendita, non per sensazione. Allora si decide se Llama, Mistral, Qwen, uno specialista più piccolo o un'API proprietaria è adatto.

Il miglior confronto dei modelli non avviene su una pagina web di benchmark. Avviene nella pipeline, tra esportazione CRM, PDF del prodotto, maschera di approvazione e il primo cliente che risponde a un'email supportata dall'AI. A volte la risposta è un appuntamento. A volte è un'indicazione di un campo dati errato. Entrambi sono preziosi. Solo uno di essi è nel benchmark.

Amplifa: Startseite · Produkt · AI SDR Agents · ICP Playbook · Über uns · Gespräch vereinbaren · Webinar

Ressourcen: Blog · Vertriebslexikon · Studien · Guides · Workflows · Tool-Vergleich · Email Finder · Intent Finder · Lookalike Finder · Tools

Branchen: Maschinenbau · Medizintechnik · Automobil · Chemie · Elektronik · Metallindustrie · Kunststofftechnik · Lebensmittel · Verpackung · Konsumgüter · Energie · Software

Success Stories: Übersicht · Wingcopter · Schnaithmann · Ottobock · Xandor · MK Kögel · Zeller+Gmelin · MagnetWorld · Persil Wäscheservice

Rechtliches: Impressum · Datenschutz · AGB

Branchenverbände & Quellen: VDMA · ZVEI · BME · Bitkom · BVMW · VCI · VDA · BVMed · Statista · Destatis

Bewertungen & Vergleich: G2 · Capterra · Gartner · OMR Reviews

Amplifa Profile: LinkedIn · X / Twitter · Anthony Filipiak (CEO) · Leon J. Hermann (COO)