Una ricerca su Google non deve più necessariamente iniziare da una parola. Può iniziare da una fotografia, da qualcosa inquadrato con lo smartphone o da un oggetto cerchiato sullo schermo.
Dal 24 settembre 2026 Google rende finalmente più visibile anche questo pezzo della ricerca: Search Console può distinguere le ricerche multimodali.
È una novità apparentemente tecnica, ma racconta bene dove sta andando Search. Se fino a ieri la domanda era “per quali parole chiave mi trovano?”, oggi dobbiamo aggiungerne un’altra: per quali immagini, oggetti e contesti visivi mi trovano?
Che cosa ha introdotto Google
Google ha annunciato un nuovo filtro per la ricerca multimodale nei report Prestazioni di Search Console, sia nei risultati di ricerca sia nel rapporto dedicato alle funzionalità di intelligenza artificiale generativa.
I dati comprendono le ricerche effettuate attraverso Google Lens, Circle to Search su Android, il caricamento di immagini nella Ricerca Google e la funzione di Chrome per cercare un’immagine.
Google Lens permette di cercare partendo da ciò che vede la fotocamera o da un’immagine già esistente: invece di descrivere un oggetto a parole, possiamo fotografarlo e chiedere a Google di riconoscerlo, trovare informazioni o prodotti simili. Circle to Search, in italiano Cerchia e Cerca, consente invece di cerchiare, evidenziare o toccare qualcosa che vediamo sullo schermo di uno smartphone Android e avviare subito una ricerca senza cambiare app.
Il rollout è globale. Naturalmente il filtro inizierà a mostrare dati soltanto sui siti che ricevono effettivamente traffico da questo tipo di ricerche.
La novità vera: la query può essere un’immagine
Per anni abbiamo ragionato sulla SEO partendo quasi sempre da parole e frasi. Scarpe rosse. Lampada da tavolo. Come verniciare un mobile. Hotel vicino al mare.

Ma una persona oggi può semplicemente mostrare a Google quello che sta guardando.
Può fotografare una lampada e cercarne una simile. Può cerchiare una borsa vista in un video. Può caricare la foto di una pianta per capire quale sia. Può partire da un’immagine e aggiungere una domanda.
La ricerca diventa quindi multimodale: testo e immagini possono partecipare insieme alla costruzione della richiesta.
E ora Search Console ci permette di isolare questa parte del comportamento degli utenti.
Per gli ecommerce è particolarmente interessante
Il cambiamento può diventare molto concreto per ecommerce e siti nei quali l’aspetto visivo del prodotto conta.
Moda, arredamento, illuminazione, design, piante, turismo, automotive, food: sono tutti ambiti nei quali una fotografia può descrivere ciò che una persona desidera meglio di dieci parole.
Questo significa che le immagini non sono più soltanto qualcosa che rende una pagina più bella. Possono diventare un vero punto di ingresso nella ricerca.
Immagini originali e di qualità, file comprensibili, testo alternativo pertinente, contenuto circostante chiaro e informazioni strutturate sul prodotto diventano quindi ancora più importanti. Non perché esista una nuova formula magica per “posizionarsi su Lens”, ma perché Google deve comprendere bene che cosa sta vedendo e a quale entità, prodotto o contenuto quell’immagine appartiene.
E se la ricerca uscisse dallo smartphone?
Qui si apre una prospettiva ancora più interessante. Oggi Lens usa già la fotocamera e Google ha sviluppato esperienze in cui la ricerca interpreta immagini e contesto visivo. Il passaggio successivo, in termini di esperienza utente, potrebbe essere una ricerca sempre più vicina a ciò che stiamo guardando, senza dover prima trasformarlo in parole.
È la stessa direzione che abbiamo osservato parlando di Meta Connect 2026 e degli occhiali AI: dispositivi indossabili con fotocamera e intelligenza artificiale possono interpretare il mondo dalla prospettiva di chi li indossa.
Google non sta annunciando con questo aggiornamento di Search Console una “SEO per gli occhiali”. Sarebbe un salto che i dati non consentono di fare. Ma la ricerca multimodale rende concreto il presupposto tecnologico: una ricerca può partire da ciò che una macchina vede, non soltanto da ciò che una persona scrive.
Se domani questa modalità diventasse normale negli occhiali AI, la domanda per aziende e siti sarebbe affascinante: come facciamo a essere riconosciuti quando l’utente non cerca più una parola, ma guarda direttamente un prodotto, un luogo o un oggetto?
Dalla SEO testuale alla SEO multimodale?
La SEO, Search Engine Optimization, cioè l’ottimizzazione per i motori di ricerca, non smette di funzionare. Semplicemente si allarga il campo.
Una pagina può essere scoperta attraverso una query scritta, un’immagine, una combinazione di immagine e testo oppure una risposta generata dall’intelligenza artificiale.
Lo stesso sta accadendo con la GEO, Generative Engine Optimization, cioè l’ottimizzazione dei contenuti affinché siano comprensibili e utilizzabili dai motori generativi.
Testo, immagini, dati strutturati, informazioni sul prodotto, autore, brand e contesto della pagina non sono più mondi separati. Sono segnali differenti che aiutano i sistemi a capire che cosa rappresenta realmente una pagina.
Search Console sta diventando la mappa della nuova ricerca
Ad agosto avevamo raccontato nell’Osservatorio come Google Search Console stesse iniziando a misurare la visibilità nelle funzionalità AI.
Questo nuovo aggiornamento aggiunge un altro tassello.
Prima misuravamo soprattutto la ricerca tradizionale. Poi Google ha iniziato a mostrarci la presenza nelle esperienze generative. Ora possiamo distinguere anche la ricerca che nasce da un’immagine.
Non è soltanto Search Console che sta aggiungendo filtri. È Search che sta diventando qualcosa di diverso.
Cosa controllare adesso
La prima cosa è molto semplice: aprire Search Console e verificare se nel rapporto Prestazioni compare il nuovo filtro relativo alla ricerca multimodale e se il sito sta già raccogliendo dati.
Poi vale la pena osservare quali pagine ricevono questa visibilità. Potremmo scoprire che prodotti o contenuti poco evidenti nelle normali query testuali funzionano molto meglio quando la ricerca parte da un’immagine.
Per un ecommerce questo potrebbe perfino cambiare il modo di valutare il catalogo fotografico: non soltanto immagini utili a convincere chi è già arrivato sulla pagina, ma immagini capaci di contribuire a farci trovare.
La domanda dell’Osservatorio redomino
Per molto tempo abbiamo cercato di capire quali parole digitassero le persone.
Adesso una parte delle persone potrebbe non digitare quasi nulla.
Mostrerà una cosa a Google e chiederà: “Dove la trovo?” “Quanto costa?” “Cos’è?” “Ne esiste una simile?”
La SEO non dovrà quindi soltanto imparare a rispondere alle parole.
Dovrà imparare a farsi riconoscere.
Domande frequenti sulla ricerca multimodale
Che cos’è la ricerca multimodale?
È una ricerca che può utilizzare più tipi di input, per esempio un’immagine insieme a testo o contesto. In Google comprende esperienze come Lens, Circle to Search e il caricamento di immagini nella Ricerca.
Dove vedo questi dati in Search Console?
Google ha introdotto un nuovo filtro dedicato alla ricerca multimodale nei report Prestazioni. I dati compaiono quando il sito riceve traffico da queste esperienze.
Devo cambiare la mia strategia SEO?
Non serve inventare una SEO separata. Diventa però ancora più importante curare immagini originali e comprensibili, testo alternativo pertinente, contesto della pagina e dati strutturati quando appropriati.
La ricerca multimodale riguarda solo gli ecommerce?
No. Gli ecommerce sono un caso particolarmente evidente, ma il principio interessa qualsiasi sito nel quale immagini, luoghi, oggetti, persone o contenuti visivi aiutino Google a comprendere ciò che l’utente sta cercando.
Se vuoi capire come cambia la visibilità del tuo sito tra Google, ricerca multimodale e intelligenza artificiale, concediti un Momento redomino.
