> ## Content Index
> Fetch the complete content index at: https://www.alessiopomaro.it/llms.txt
> Use this file to discover other available public pages before exploring further.

# Generative AI: novità e riflessioni - #1 / 2024
- URL: https://www.alessiopomaro.it/generative-ai-novita-riflessioni-1-2024/
- Published: 2024-01-31T07:00:08.000Z
- Updated: 2024-03-23T05:04:38.000Z
- Description: Un appuntamento per aggiornarsi e riflettere sulle tematiche che riguardano l'intelligenza artificiale e la Generative AI.
- Author: Alessio Pomaro
- Tags: AI, GPT, Novità e Riflessioni

Spesso mi vengono chiesti dei suggerimenti per mantenere un livello di aggiornamento adeguato sulle tematiche che riguardano l'[**Intelligenza Artificiale**](https://www.alessiopomaro.it/tag/ai/). Non è semplice, vista l'accelerazione, lo so bene.

Proprio per questo, ho ideato una rubrica che ripercorre le novità più rilevanti con qualche riflessione, e questo è il primo appuntamento.

> **Buon aggiornamento,** 
> **e buone riflessioni..**

---

## **Le novità dalla Generative AI e qualche riflessione**

**OpenAI** ha rivoluzionato il settore un anno fa, e nell'ultima conferenza per sviluppatori ha mostrato delle possibilità incredibili che andranno a **cambiare per sempre la creazione di contenuti**, la **UX**, e non solo. Ma OpenAI è solo una parte dello scenario.

> Quello che segue è il mio intervento alla **Bologna Tech Week** (**Search Marketing Connect)** di dicembre, in cui cerco di dare una visione e un ordine su tutti questi aspetti.

Search Marketing Connect 2023

---

## **AI ACT + Azione del Garante della Privacy nei confronti di OpenAI**

Condivido due risorse interessanti per chi vuole aggiornarsi, chiarire e riflettere su due tematiche "*calde*" legate all'intelligenza artificiale.

### AI ACT

[**Luciano Floridi**](https://twitter.com/Floridi?ref=alessiopomaro.it) e diversi ospiti intervengono e dialogano sulla regolamentazione dello sviluppo che riguarda l'**intelligenza artificiale**.

[Le regole - Ep. 1L’intelligenza artificiale e le regole utili a governarla. Scopriamo cosa si intende per A.I. e come i governi stanno cercando di massimizzare i vantaggi e ridurre i rischi della nuova tecnologia. Con Giuseppe De Bellis e Luciano Floridi,![](https://d1sojsgu0jwtb7.cloudfront.net/images/favicons/spreaker/icon.svg)Spreaker![](https://d3wo5wojvuv7l.cloudfront.net/t_facebook_share/images.spreaker.com/original/9706b55c1723d3fd9ca9ca4cb233bcf4.jpg)](https://www.spreaker.com/episode/le-regole-ep-1--58444365?ref=alessiopomaro.it)

> "Ogni scoperta porta con sé grandi inquietudini collettive, ma altrettante opportunità".

### [Notifica del Garante della Privacy a OpenAI](https://www.garanteprivacy.it/home/docweb/-/docweb-display/docweb/9978020?ref=alessiopomaro.it): l'atto di contestazione per le violazioni alla normativa privacy

**Matteo Flora** e l'avv. **Giuseppe Vaciago** chiariscono il tema e discutono sulla recente azione.

Il Garante ancora contro ChatGPT? - Matteo Flora

---

## **Come usare diversi GPTs nella stessa chat di ChatGPT**

Come possiamo usare diversi **GPTs** che elaborano i dati nella stessa chat su **ChatGPT**? Semplicemente taggando il GPT che ci serve nel prompt con il carattere "@". 

![GPT mentions](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/multi-gpts-chatgpt.webp)

Nell'esempio, uso il GPT di "***Link Reader***" per estrarre link dalla SERP, e successivamente quello di "***WebPilot***" per elaborarne il contenuto. 

> Il mio dubbio sui GPTs è stato risolto. Direi che ora sono sovrapponibili ai plugin, i quali non dureranno a lungo.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/gpts-1-link-reader.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/gpts-2-link-reader-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/gpts-3-webpilot-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/gpts-4-webpilot-1.webp)

---

## **Il futuro dell'AI è neuro-simbolico?**

Durante il [WMF 2023](https://www.alessiopomaro.it/ai-generativa-futuro/) dissi che forse una via per l'AI del futuro sarà il ricongiungimento delle due teorie dalle quali ha preso vita: le **reti neurali** e i **sistemi simbolici**. Per puntare a un'AI veloce, scalabile e in grado di astrarre, ma anche solida nel rappresentare i fatti e il ragionamento. 

[**AlphaGeometry**](https://deepmind.google/discover/blog/alphageometry-an-olympiad-level-ai-system-for-geometry/?ref=alessiopomaro.it), il sistema che recentemente ha risolto difficili problemi matematici (*livello scuola superiore*), è esattamente questo: un sistema "***neuro-simbolico***". 

> La combinazione del ragionamento speculativo neurale con la conoscenza logica strutturata promette sistemi integrati che pensano in modo flessibile e rigoroso. Questa fusione offre **un percorso solido per coltivare un ragionamento automatizzato a tutto tondo**, simile a quello umano.

[Solving olympiad geometry without human demonstrations - NatureA new neuro-symbolic theorem prover for Euclidean plane geometry trained from scratch on millions of synthesized theorems and proofs outperforms the previous best method and reaches the performance of an olympiad gold medallist.![](https://www.nature.com/static/images/favicons/nature/apple-touch-icon-f39cb19454.png)NatureTrieu H. Trinh![](https://media.springernature.com/m685/springer-static/image/art%3A10.1038%2Fs41586-023-06747-5/MediaObjects/41586_2023_6747_Fig1_HTML.png)](https://www.nature.com/articles/s41586-023-06747-5?ref=alessiopomaro.it)

---

## **Code Llama 70B**

Meta ha rilasciato **Code Llama 70B**: un nuovo sistema più performante per la generazione di codice basato su LLM. 

Ha una versione specifica per **Python**, e le prestazioni sono tra le più elevate rispetto agli altri modelli di questo tipo. 

> Ottiene un punteggio di 67,8 su [**HumanEval**](https://paperswithcode.com/sota/code-generation-on-humaneval?ref=alessiopomaro.it).

[Introducing Code Llama, a state-of-the-art large language model for codingCode Llama, which is built on top of Llama 2, is free for research and commercial use.![](https://static.xx.fbcdn.net/rsrc.php/v3/y4/r/WUJbsVI4ruF.png)![](https://scontent.xx.fbcdn.net/v/t39.2365-6/369846493_992514825293813_1706297657378891605_n.jpg?_nc_cat=100&ccb=1-7&_nc_sid=e280be&_nc_ohc=28T_FCqne3IAX8dCZOr&_nc_ht=scontent.xx&oh=00_AfDiV1s34WNFafNb4vJutZjBg6RqBkzMyG-ssf8fiS8DzA&oe=65D27289)](https://ai.meta.com/blog/code-llama-large-language-model-coding/?ref=alessiopomaro.it)

---

## **Google Bard (Gemini Pro) migliora**

Non me lo sarei mai aspetto, ma **Bard**, equipaggiato con [**Gemini Pro**](https://deepmind.google/technologies/gemini/?ref=alessiopomaro.it), balza al secondo posto della "[***LLM Arena Leaderboard***](https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard?ref=alessiopomaro.it)" (*una delle classifiche più attendibili per i modelli*). 

Ho fatto alcuni test ultimamente, con prompt evoluti che uso con **GPT-4** e ho ottenuto risposte ottime e veloci. 

Fino a qualche giorno fa, in questa classifica, **OpenAI** era nelle prime 3 posizioni. Sono contento che Google rientri in pista. 

> Cosa dovremo aspettarci dalla versione Ultra? Gli altri non staranno a guardare, comunque.

![Gemini di Google: LLM Arena Leaderboard](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/gemini-arena-leaderboard.webp)

---

## **InstantID: generazione di immagini preservando i tratti delle persone**

**InstantID** è una nuova soluzione per la generazione delle immagini preservando i tratti delle persone, analizzando una sola immagine facciale.

Si basa su un **modello di diffusione**, e si integra con modelli pre-addestrati, come **Stable Diffusion XL**.

> Supera le tecniche precedenti in termini di fedeltà e adattabilità dello stile, senza richiedere un'intensa messa a punto.

[GitHub - InstantID/InstantID: InstantID : Zero-shot Identity-Preserving Generation in Seconds 🔥InstantID : Zero-shot Identity-Preserving Generation in Seconds 🔥 - GitHub - InstantID/InstantID: InstantID : Zero-shot Identity-Preserving Generation in Seconds 🔥![](https://github.githubassets.com/assets/pinned-octocat-093da3e6fa40.svg)GitHubInstantID![](https://opengraph.githubassets.com/ccfc66f565ce8e35228a19566b37e7b7ad14f8789feea5ecffab1c60a2dbfc4b/InstantID/InstantID)](https://github.com/InstantID/InstantID?ref=alessiopomaro.it)

---

## **Modelli di linguaggio: cosa sono, perché se ne parla tanto e che futuro avranno**

In un'intervista su **La Repubblica** racconto i **modelli di linguaggio (*LLM*)**.  
Che impatto avranno? Quali sono i rischi? Perché l'open source rappresenta una via interessante? Che differenza c'è tra i vecchi chatbot e le nuove tecnologie?

> "..i modelli generativi offriranno strumenti sempre più avanzati integrati nei flussi operativi per la ricerca e l’elaborazione dei dati, e per ottenere automazioni sempre più profonde".

[Modelli di linguaggio: cosa sono, perché se ne parla tanto e che futuro avrannoI modelli di linguaggio di grandi dimensioni sono diffusi e ampiamente usati. Offrono vantaggi, non sono privi di sfide e inside ma, come insegna GPT-4, il lor…![](https://www.repstatic.it/cless/main/nazionale/2016-v1/img/common/favicon/apple-touch-icon-120.png)la Repubblicadi Giuditta Mosca![](https://www.repstatic.it/content/contenthub/img/2024/01/07/114905664-c0bbb094-aef5-4ede-93da-7bda9187f9d3.jpg)](https://www.repubblica.it/tecnologia/2024/01/07/news/modelli%5Fdi%5Flinguaggio%5Fcosa%5Fsono%5Fperche%5Fse%5Fne%5Fparla%5Ftanto%5Fe%5Fche%5Ffuturo%5Favranno-421823928/?ref=alessiopomaro.it)

---

## **Novità importanti per OpenAI**

OpenAI introduce nuovi sviluppi che riguardano i modelli e le API.

- **GPT-3.5 Turbo** migliora e verranno ridotti i costi (-50% per i token in input e -25% per l'output).
- Finalmente arrivano 2 nuovi modelli di **embeddings**, più performanti e a costi minori.
- **GPT-4 Turbo** ottimizza la generazione del codice e la tendenza alla "*pigrizia*".
- Migliorano le **API di moderazione**.
- Finalmente il **monitoraggio del consumo delle API** è stato ampliato: ora è possibile controllare i costi per progetto.

> Segnali di maturità dello stack tecnologico e di obiettivi di miglioramento non solo orientato alle performance.

[New embedding models and API updatesWe are launching a new generation of embedding models, new GPT-4 Turbo and moderation models, new API usage management tools, and soon, lower pricing on GPT-3.5 Turbo.![](https://openai.com/favicon.ico)![](https://images.openai.com/blob/ec19d092-e613-41c0-8dcb-57e030658420/new-embeddings-models-and-api-updates.jpg?trim=0%2C0%2C0%2C0&width=1000&quality=80)](https://openai.com/blog/new-embedding-models-and-api-updates?ref=alessiopomaro.it)

---

## **26 principi per migliorare le performance dei Large Language Model (LLM)**

Come si possono **migliorare le performance di un LLM fino al 50%**? Questo nuovo paper mostra 26 principi da seguire.  
I test sono stati eseguiti su **LLaMA-1/2** (*7B, 13B e 70B*) e **GPT-3.5/4**.

> Basta per ottenere ottimi risultati? NO, serve tanta **sperimentazione**. E la prova è il fatto che nei prompt delle automazioni in produzione che usiamo in azienda, applichiamo già quasi tutti questi principi con dei precisi schemi, ottenuti grazie a una grande quantità di test.

> Va ricordato, inoltre, che i **dati di contesto** sono un elemento determinante per ottenere performance elevate.

[GitHub - VILA-Lab/ATLAS: A principled instruction benchmark on formulating effective queries and prompts for large language models (LLMs). Our paper: https://arxiv.org/abs/2312.16171A principled instruction benchmark on formulating effective queries and prompts for large language models (LLMs). Our paper: https://arxiv.org/abs/2312.16171 - GitHub - VILA-Lab/ATLAS: A principled…![](https://github.githubassets.com/assets/pinned-octocat-093da3e6fa40.svg)GitHubVILA-Lab![](https://opengraph.githubassets.com/50ef15da3338a652046495b2b58304de84892a6bdf7842b70064ec6ef5e568aa/VILA-Lab/ATLAS)](https://github.com/VILA-Lab/ATLAS?ref=alessiopomaro.it)

---

## **La Generative AI nel video editing**

Un esempio di **editing video** in cui vengono inseriti elementi crearti attraverso l'**AI Generativa**. Tutto il processo avviene con After Effects. **Midjourney** e [**Runway Gen 2**](https://research.runwayml.com/gen2?ref=alessiopomaro.it) vengono usati per creare Voldemort nella parte finale e per il cielo. 

L'AI Generativa, integrata nei processi di produzione, permette di mantenere il focus nelle parti principali, generando il contorno (*che comunque richiederebbe grande effort*). 

Editing: [Eric Del Aguila](https://twitter.com/delaguila%5Feric?ref=alessiopomaro.it).

La Generative AI nel video editing

---

## **LLM-as-a-Judge**

Gli approcci attuali, comunemente, addestrano **modelli di ricompensa** dalle preferenze umane. E questi modelli non migliorano durante il training.

In questo studio, viene usato il LLM come "*giudice*" per stabilire le ricompense durante il training.

Questo approccio su **Llama 2 70B** produce un modello che supera diversi sistemi molto noti (*Claude 2, Gemini Pro e GPT4 0613*) nella classifica [AlpacaEval 2.0](https://github.com/tatsu-lab/alpaca%5Feval?ref=alessiopomaro.it).

Si tratta di uno studio preliminare, ma si aprono nuove porte.

[Self-Rewarding Language ModelsWe posit that to achieve superhuman agents, future models require superhuman feedback in order to provide an adequate training signal. Current approaches commonly train reward models from human preferences, which may then be bottlenecked by human performance level, and secondly these separate frozen reward models cannot then learn to improve during LLM training. In this work, we study Self-Rewarding Language Models, where the language model itself is used via LLM-as-a-Judge prompting to provide its own rewards during training. We show that during Iterative DPO training that not only does instruction following ability improve, but also the ability to provide high-quality rewards to itself. Fine-tuning Llama 2 70B on three iterations of our approach yields a model that outperforms many existing systems on the AlpacaEval 2.0 leaderboard, including Claude 2, Gemini Pro, and GPT-4 0613\. While only a preliminary study, this work opens the door to the possibility of models that can continually improve in both axes.![](https://arxiv.org/static/browse/0.3.4/images/icons/apple-touch-icon.png)arXiv.orgWeizhe Yuan![](https://arxiv.org/static/browse/0.3.4/images/arxiv-logo-fb.png)](https://arxiv.org/abs/2401.10020?ref=alessiopomaro.it)

---

## **Un test di Mixtral 8x7b in confronto a GPT-4**

Come si comporta **Mixtral 8x7b** rispetto a **GPT-4** su un task di classificazione di contenuti e labeling?

I due output a confronto mostrano come Mixtral si difende benissimo, rispettando il formato dell'output e estraendo dati allineati al contenuto (una scheda di un tour guidato).

> **Mixtral è in esecuzione in locale**, quindi, per un lavoro ampio, potrebbe rappresentare un buon risparmio sui costi.

Chiaramente i topic estratti sono diversi perché i modelli non hanno istruzioni specifiche su questo.

![Un confronto tra Mixtral e GPT-4](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/confronto-mixtral-gpt4.webp)

Un confronto tra Mixtral e GPT-4

---

## **Finalmente un progetto italiano per la creazione di un LLM**

Ne parlavamo proprio durante il [**Search Marketing Connect**](https://www.searchmarketingconnect.it/?ref=alessiopomaro.it) a dicembre.  
Mi fa davvero piacere. Ho alcuni dubbi sulle performance a confronto con i competitor noti. La questione AI Act (*in riferimento al post de Il Sole 24 Ore*) è interessante e importantissima, ma le prestazioni..

> Ma questo lo scopriremo insieme.

[Cineca e iGenius insieme: nasce la prima Intelligenza Artificiale generativa italianaLa nuova tecnologia, promette il fondatore Uljan Sharka, sarà disponibile prima dell’estate. Il training fatto sul supercalcolatore Leonardo, a Bologna![](https://www.ilsole24ore.com/apple-touch-icon/apple-touch-icon-180x180.png)Il Sole 24 ORELuca De Biase![](https://i2.res.24o.it/images2010/S24/Documenti/2024/01/25/Immagini/Ritagli/ai-U32432665240buZ-1440x752@IlSole24Ore-Web.jpg?r=1170x507)](https://www.ilsole24ore.com/art/cineca-e-igenius-insieme-nasce-prima-intelligenza-artificiale-generativa-italiana-AF5Dc8RC?ref=alessiopomaro.it)

---

## **Stable LM 2 1.6B di Stability AI**

> Un equilibrio tra velocità e prestazioni.. 

[**Stability AI**](https://stability.ai/?ref=alessiopomaro.it) ha lanciato **Stable LM 2 1.6B**, un LLM di piccole dimensioni open source dalle performance elevate.  
Saranno disponibili anche i dettagli sui dati, che saranno a disposizione per altri modelli.

> Grazie a questi modelli, le aziende potranno sviluppare sistemi custom di qualità a costi ridotti, ma attenzione alla sicurezza!

[Introducing Stable LM 2 1.6B — Stability AIToday, we are introducing our first language model from the new Stable LM 2 series: the 1.6 billion parameter base model and an instruction-tuned version.![](https://images.squarespace-cdn.com/content/v1/6213c340453c3f502425776e/cfbf5bc5-47d4-4f4a-b133-23bd12a7d7c2/favicon.ico?format=100w)Stability AIAnel Islamovic![](http://static1.squarespace.com/static/6213c340453c3f502425776e/62f2452bc121595f4d87c713/65a91a8c8d446e2cf8c7189a/1706016082208/Stable_LM_2_1.6b.png?format=1500w)](https://stability.ai/news/introducing-stable-lm-2?ref=alessiopomaro.it)

---

## **Gemini a servizio di Google Ads**

Google mette a disposizione **Gemini** per un assistente che potrà aiutare a **creare campagne su Ads**.  
Un chatbot in piattaforma che può generare headlines, description e immagini in base agli URL di riferimento.

> L'AI Generativa è sempre più integrata nelle piattaforme, su applicazioni semplici, ma che possono ridurre sensibilmente l'effort e migliorare le performance.

[Put Google AI to work with Search adsThe conversational experience in Google Ads is now powered by Gemini and beta access is rolling out to all English language advertisers.![](https://blog.google/static/blogv2/images/apple-touch-icon.png)GoogleShashi Thakur![](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/CAA_Blog_Post_Hero_Image_Updated_2.width-1300.png)](https://blog.google/products/ads-commerce/put-google-ai-to-work-with-search-ads/?ref=alessiopomaro.it)

---

## **Mamba: un nuovo approccio più efficiente e scalabile**

> Dopo la fase crescita, forse è   
> arrivato il tempo dell'efficienza.

**Mamba** rappresenta un significativo passo in avanti nel campo dell'**AI**, offrendo un approccio più efficiente e scalabile per l'**elaborazione di sequenze di dati**.

Perché è innovativo? A differenza dei modelli **Transformer**, che tendono a trattare ogni parte di una sequenza come egualmente importante, Mamba può selezionare le parti più rilevanti.

Questo lo rende efficiente anche su sequenze molto lunghe.

> L'evoluzione dei modelli significa performance migliori, ma anche riduzione dell'effort computazionale e dei consumi.

[Mamba: Linear-Time Sequence Modeling with Selective State SpacesFoundation models, now powering most of the exciting applications in deep learning, are almost universally based on the Transformer architecture and its core attention module. Many subquadratic-time architectures such as linear attention, gated convolution and recurrent models, and structured state space models (SSMs) have been developed to address Transformers’ computational inefficiency on long sequences, but they have not performed as well as attention on important modalities such as language. We identify that a key weakness of such models is their inability to perform content-based reasoning, and make several improvements. First, simply letting the SSM parameters be functions of the input addresses their weakness with discrete modalities, allowing the model to selectively propagate or forget information along the sequence length dimension depending on the current token. Second, even though this change prevents the use of efficient convolutions, we design a hardware-aware parallel algorithm in recurrent mode. We integrate these selective SSMs into a simplified end-to-end neural network architecture without attention or even MLP blocks (Mamba). Mamba enjoys fast inference (5$\\times$ higher throughput than Transformers) and linear scaling in sequence length, and its performance improves on real data up to million-length sequences. As a general sequence model backbone, Mamba achieves state-of-the-art performance across several modalities such as language, audio, and genomics. On language modeling, our Mamba-3B model outperforms Transformers of the same size and matches Transformers twice its size, both in pretraining and downstream evaluation.![](https://arxiv.org/static/browse/0.3.4/images/icons/apple-touch-icon.png)arXiv.orgAlbert Gu![](https://arxiv.org/static/browse/0.3.4/images/arxiv-logo-fb.png)](https://arxiv.org/abs/2312.00752?ref=alessiopomaro.it)

---

## **L'innovazione di Rabbit R1**

Sto leggendo molti commenti su [**Rabbit R1**](https://www.rabbit.tech/updates/introducing-r1?ref=alessiopomaro.it). Un aspetto, secondo me, non è passato in modo esaustivo.

> La vera innovazione non è l'assistente personale più evoluto. È il fatto che usa la "visione" per apprendere l'utilizzo di qualunque software!

La UI diventa il mezzo per far usare i sistemi ai modelli. Questo è inaspettato e straordinario.

> Lasciate stare il device nelle considerazioni: si tratta di un'appendice (molto interessante, però). Potrebbe essere sostituita da un'app? Secondo me sì, ma è il concetto l'aspetto innovativo.

![Rabbit R1](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/rabbit-r1.webp)

Rabbit R1

---

## **Prompt Generator for Images**

In occasione della seconda edizione del seminario "[***AI per Agenzie e Team Digital***](https://accademia.searchon.it/next/events/ai-per-agenzie-team-digital/?ref=alessiopomaro.it)" ho creato un GPT Custom in grado di guidare alla **creazione di prompt per la generazione di immagini**.

Puoi provarlo e usarlo gratuitamente.

[ChatGPT - Prompt Generator for imagesGenero prompt per i modelli di generazione delle immagini, per aiutarti a usare i modelli Text-To-Image![](https://cdn.oaistatic.com/_next/static/media/apple-touch-icon.59f2e898.png)ChatGPT![](https://files.oaiusercontent.com/file-6hP0GxzJqs89JYGl4jNinRHk?se=2123-12-26T16%3A22%3A35Z&sp=r&sv=2021-08-06&sr=b&rscc=max-age%3D1209600%2C%20immutable&rscd=attachment%3B%20filename%3DDALL%25C2%25B7E%25202024-01-19%252017.20.40%2520-%2520Create%2520an%2520image%2520of%2520a%2520woman%2527s%2520portrait%2520blending%2520into%2520an%2520abstract%2520array%2520of%2520vibrant%2520colors%2520and%2520dynamic%2520brushstrokes.%2520The%2520woman%2520has%2520a%2520realistic%2520facial%2520str.png&sig=48ctDoAYmJqXaWry40aiNmonkNR07L7a2nB/r4S/p5Q%3D)](https://chat.openai.com/g/g-scYbnKveU-prompt-generator-for-images?ref=alessiopomaro.it)

---

## **La direzione di Meta in ambito AI**

Zuckerberg parla della direzione di Meta in ambito di AI: creare una **general intelligence** e renderla **open source** in modo **responsabile**, in modo che tutti possano trarne vantaggio.

Stanno addestrando **Llama3** e creando un'infrastruttura di elaborazione impressionante: arriverà ad avere **600k H100** (***GPU Nvidia***).

> Un progetto ambizioso, soprattutto per il fatto che viene messo in chiave open source.

![Zuckerberg parla della direzione di Meta in ambito di AI](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/zuckerberg-llama3-nvidia-1.webp)

Zuckerberg parla della direzione di Meta in ambito di AI

---

## **Perplexity e Rabbit: una nuova partnership**

Mancava solo l'ufficialità della partnership tra [**Perplexity** ](https://www.perplexity.ai/?ref=alessiopomaro.it)e **Rabbit**. Eccola!

> Perplexity alimenterà le risposte di Rabbit R1, il sistema che probabilmente è stata la rivelazione del CES 2024.

> We're thrilled to announce our partnership with Rabbit: Together, we are introducing real-time, precise answers to Rabbit R1, seamlessly powered by our cutting-edge PPLX online LLM API, free from any knowledge cutoff. Plus, for the first 100,000 Rabbit R1 purchases, we're… [pic.twitter.com/hJRehDlhtv](https://t.co/hJRehDlhtv?ref=alessiopomaro.it)
> 
> — Perplexity (@perplexity\_ai) [January 18, 2024](https://twitter.com/perplexity%5Fai/status/1748104763470680181?ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it)

---

## **Gemini Pro di Google sul nuovo Samsung S24**

L'**AI Generativa** verrà integrata su ogni piattaforma.. l'ho detto spesso ultimamente. Ed ecco **Gemini Pro di Google** sul nuovo Samsung S24.  
Applicato a nuovi modi di effettuare ricerche, sintesi automatiche delle comunicazioni mentre si è alla guida e delle registrazioni vocali, editing delle immagini.

> Mentre Microsoft porta Copilot su Windows, Google è pronta allo stesso passo su Android.

[La potenza dell’IA di Google arriva sulla nuova serie Samsung Galaxy S24Da Android alla Ricerca Google, passando per Android Auto e altro ancora: la collaborazione di Google con Samsung apre a nuove potenzialità grazie all\\u0027intelligenza artif…![](https://blog.google/static/blogv2/images/apple-touch-icon.png)GoogleHiroshi Lockheimer![](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/21424_ANC_Unpacked_blog_post_header_OP13x_jUY.width-1300.png)](https://blog.google/intl/it-it/prodotti/la-potenza-dellia-di-google-arriva-sulla-nuova-serie-samsung-galaxy-s24/?ref=alessiopomaro.it)

---

## **Circle to Search e AI-Powered Multisearch di Google**

Google presenta due nuove modalità di ricerca: **Circle to Search** e **AI-Powered Multisearch**.  
In qualunque schermata, su Android, sarà possibile cerchiare un elemento e avviare una ricerca per quell'elemento.

Alla ricerca multimodale di **Multisearch** viene aggiunta **SGE** (*Search Generative Experience*) nelle risposte.  
La **multimodalità** è la direzione verso la quale tutte le interfacce si stanno dirigendo. Di fatto consente esperienze non attuabili in altre modalità.

[New ways to search in 2024We’re launching Circle to Search and an AI\\u002Dpowered multisearch experience to help you search even more naturally.![](https://blog.google/static/blogv2/images/apple-touch-icon.png)GoogleElizabeth Reid![](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/SGE_Jan2024_Circle-to-Search_1.width-1300.png)](https://blog.google/products/search/google-search-ai-january-2024-update/?ref=alessiopomaro.it)

---

## **La direzione dello sviluppo di OpenAI**

In che direzione sta andando lo **sviluppo di OpenAI**? **Altman** lo racconta a **Gate**.  
Non ci sono grandi sorprese..

- **Multimodalità** (*inclusi input audio e video*),
- Miglioramento del "*ragionamento*" e dell'**affidabilità**,
- Interazione con dati degli utenti (*e-mail, calendari, ecc.*) per **personalizzare l'esperienza**.

Due elementi importanti emergono oltre i tecnicismi: la necessità di **regolamentazione** (*non è importante solo per gli utenti, ma anche per chi sviluppa i modelli*) e la proiezione di riduzione dei **costi dei modelli** e dei servizi.

> **GPT-5** in arrivo?

Bill Gates e Sam Altman

---

## **LLM e sicurezza**

Un interessante studio di [**Anthropic**](https://www.anthropic.com/?ref=alessiopomaro.it) mostra come un modello può essere addestrato ad essere ingannevole.  
È abbastanza chiaro: il modello "*genera*" seguendo delle istruzioni, e se le istruzioni sono precise, verranno eseguite.

Se si sperimenta con i **GPTs** e con i **system prompt** si può toccare facilmente con mano la resistenza nel rispettare il training. Di fatto, l'obiettivo è proprio questo.

> È sempre più chiaro che servono sistemi per mettere in ordine e governare tutto questo.

[Sleeper Agents: Training Deceptive LLMs that Persist Through Safety TrainingHumans are capable of strategically deceptive behavior: behaving helpfully in most situations, but then behaving very differently in order to pursue alternative objectives when given the opportunity. If an AI system learned such a deceptive strategy, could we detect it and remove it using current state-of-the-art safety training techniques? To study this question, we construct proof-of-concept examples of deceptive behavior in large language models (LLMs). For example, we train models that write secure code when the prompt states that the year is 2023, but insert exploitable code when the stated year is 2024\. We find that such backdoor behavior can be made persistent, so that it is not removed by standard safety training techniques, including supervised fine-tuning, reinforcement learning, and adversarial training (eliciting unsafe behavior and then training to remove it). The backdoor behavior is most persistent in the largest models and in models trained to produce chain-of-thought reasoning about deceiving the training process, with the persistence remaining even when the chain-of-thought is distilled away. Furthermore, rather than removing backdoors, we find that adversarial training can teach models to better recognize their backdoor triggers, effectively hiding the unsafe behavior. Our results suggest that, once a model exhibits deceptive behavior, standard techniques could fail to remove such deception and create a false impression of safety.![](https://arxiv.org/static/browse/0.3.4/images/icons/apple-touch-icon.png)arXiv.orgEvan Hubinger![](https://arxiv.org/static/browse/0.3.4/images/arxiv-logo-fb.png)](https://arxiv.org/abs/2401.05566?ref=alessiopomaro.it)

---

## **I modelli Text-To-3D**

I modelli **Text-To-3D** si evolvono costantemente. Nel video si vede un mio test usando [**Genie di Luma Labs**](https://lumalabs.ai/genie?ref=alessiopomaro.it).  
Il sistema usa una rete neurale in grado di trasformare un **prompt testuale** in un **oggetto 3D**, scaricabile in diversi formati modificabili con qualunque editor.

> Questi sistemi potrebbero avere risvolti importanti in settori come l'**e-commerce** e l'**AR**.

Genie di Luma Labs

---

## **L'intelligenza artificiale può essere creativa?**

Gli algoritmi possono aiutarci a **uscire dai nostri schemi**, perché possono agire privi dei bias che ci condizionano.  
Se questo rientra nel concetto di "***creatività***", allora sì, l'AI può essere creativa.

Questo è straordinario e facilmente comprensibile in ambito scientifico. Ma andiamo in tilt quando dal concetto di creatività scivoliamo nell'**ambito artistico**.

Propongo un ulteriore esperimento oltre a quelli descritti nel post de **Il Sole 24 Ore**.

> Supponiamo che esca un nuovo disco di Elvis Presley generato dall'AI. Tecnicamente migliore di tutti quelli creati dall'artista.  
> I fan lo amerebbero? Probabilmente NO.  
> Perché **l'arte non è solo nell'estetica dell'output, ma è anche nella consapevolezza del percorso che fa arrivare all'output**.

[L’intelligenza artificiale può essere creativa? Perché non ci sono certezzeChe cosa si intende per “creatività”? Sappiamo forse decidere che cosa sia “creativo” nel caso umano, ma non abbiamo alcuna idea di quali norme applicare all’intelligenza artificiale![](https://www.ilsole24ore.com/apple-touch-icon/apple-touch-icon-180x180.png)Il Sole 24 ORERoberto Casati![](https://i2.res.24o.it/images2010/2024/01/AFAhwMHC/images/122bf424-413e-11ec-85cf-a2eddebd698b-fotohome0.jpg)](https://www.ilsole24ore.com/art/l-intelligenza-artificiale-puo-essere-creativa-perche-non-ci-sono-certezze-AFAhwMHC?ref=alessiopomaro.it)

---

## **Audiobox di Meta**

Meta ha pubblicato una demo di **Audiobox**, il modello dedicato alla **generazione di audio**.  
Il sistema produce gli output partendo da una combinazione di input vocali e testuali.

> Siamo arrivando a livelli altissimi anche nel mondo audio.

[AudioboxAudiobox is Meta’s new foundation research model for audio generation. It can generate voices and sound effects using a combination of voice inputs and natural language text prompts.![](https://audiobox.metademolab.com/M_Favicon_1632.ico)![](https://dl.fbaipublicfiles.com/audiobox/webpage/public/assets/images/audiobox_thumbnail.png)](https://audiobox.metademolab.com/?ref=alessiopomaro.it)

---

## **Midjourney V6 + Runway Gen 2 + Live Action**

In questo video, **Dave Clark** fa un uso dell'**AI generativa** che rispecchia la mia interpretazione di questo strumento (*oggi*).  
Il video, infatti è realizzato in un mix di **Midjourney V6**, **Runway Gen 2** e **Live Action**.

> Immaginiamo solo di ridurre anche una piccola parte delle scene senza attori di un film o su un lavoro video di adv. Ovvero le scene meno importanti, ma che comunque costano.  
> Solo questo sarebbe un **enorme risparmio**, inoltre gli algoritmi consentono di fare una grande quantità di **sperimentazione a basso costo**.

> Made a movie using Midjourney V6 + [@runwayml](https://twitter.com/runwayml?ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) and Live Action. The time is now for AI to push our creative at any level. Here is the teaser for a short and feature screenplay that I wrote. [#ai](https://twitter.com/hashtag/ai?src=hash&ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) [#AIArtCommuity](https://twitter.com/hashtag/AIArtCommuity?src=hash&ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) [#aifilm](https://twitter.com/hashtag/aifilm?src=hash&ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) [#aiartwork](https://twitter.com/hashtag/aiartwork?src=hash&ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) [#filmmaking](https://twitter.com/hashtag/filmmaking?src=hash&ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) [#runwayml](https://twitter.com/hashtag/runwayml?src=hash&ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it) [pic.twitter.com/wIbuQjLb2v](https://t.co/wIbuQjLb2v?ref=alessiopomaro.it)
> 
> — Dave Clark (@Diesol) [December 22, 2023](https://twitter.com/Diesol/status/1738224696204890383?ref%5Fsrc=twsrc%5Etfw&ref=alessiopomaro.it)

---

## **GPT Store e Piano Team di Open AI**

Benvenuto al **GPT Store**. Ora è possibile cercare e usare i GPTs pubblici. Rimaniamo in attesa della **monetizzazione**.  
Nel frattempo puoi provare il mio GPT.

[ChatGPT - Stats BloggerGenero diagrammi partendo da frasi e citazioni estratte da studi di settore, per supportare blogger e Social Media Manager nell’arricchimento dei contenuti.![](https://cdn.oaistatic.com/_next/static/media/apple-touch-icon.59f2e898.png)ChatGPT![](https://files.oaiusercontent.com/file-NSs7hKJVLxWwuvKOhoNbaNGR?se=2123-10-21T12%3A16%3A37Z&sp=r&sv=2021-08-06&sr=b&rscc=max-age%3D31536000%2C%20immutable&rscd=attachment%3B%20filename%3De8f395c7-4945-47fa-8224-92fbbf4a39c7.png&sig=dRXh/sKUWhMi2%2BANg/UMdXTWMTGqTeeiLj8lJZuq6mA%3D)](https://bit.ly/gpts-stats-blogger?ref=alessiopomaro.it)

È disponibile il piano "***Team***" per **ChatGPT**, come upgrade della versione Plus, con funzionalità estese.  
La parte più interessante riguarda il fatto che **i dati delle conversazioni non verranno usate per il training del modello**.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/piano-team-openai.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/gpt-store-openai.webp)

---

## Rabbit R1: una delle novità più interessanti del CES 2024

Al CES è stato presentato un concetto davvero interessante, definito **LAM (*Large Action Model*)**.  
Si tratta di un sistema che comprende l'intento dell'utente (*attraverso un LLM*) ed è in grado di **apprendere l'interfaccia** di qualunque software per mettere in azione quell'intento, indipendentemente dalla piattaforma.

Hanno anche creato un sistema operativo (***Rabbit OS***) basato su questo concetto e addirittura un dispositivo dedicato, ad interazione vocale, in grado di rispondere a domande e di interagire con qualunque servizio.  
La **modalità di apprendimento** delle operazioni custom è impressionante. 

> Se questo è il primo passo verso una **nuova generazione di assistenti virtuali multimodali**, beh.. sono molto colpito.

> Qualche anno fa, quando sviluppai una Google Action che usava un LLM per dare risposte, pensai che questo sarebbe stato il futuro degli assistenti personali.. mancava solo una tecnologia adeguata. Anche oggi di certo è ancora acerba, ma.. diciamo che la via sembra promettente.

Rabbit R1: la presentazione

---

## **Modelli di linguaggio e dati: un discusso post del The Guardian**

Ho letto diversi commenti a questo post del **The Guardian**.. 

- Prima di tutto, il tema è la quantità di dati che questi modelli necessitano in fase di training per ottenere performance, quindi attenzione a interpretare bene il titolo.
- Inoltre trovo che manchino sempre le domande fondamentali da porsi su questo tema.
- **Il problema è che l'output del modello generativo può violare il copyright? Oppure è anche il fatto che dati coperti da copyright vengono trattati per addestrare il modello a "comprendere" la semantica" degli input e a "scrivere" output sintatticamente corretti?** Dati che comunque non vengono immagazzinati, ma sono solo utili ad affinare delle rappresentazioni vettoriali.
- E se i modelli riproducono contenuti che violano il copyright, qual è la fonte? Il New York Times di turno, o il [**Common Crawl**](https://commoncrawl.org/%C3%B9?ref=alessiopomaro.it) di turno? Oggi non è possibile rispondere a questa domanda.
- E ancora.. infrange il copyright il modello che genera per mio conto un contenuto, o la responsabilità è mia se pubblico un contenuto creato dal mio "*stagista-assistente*"?
- E ancora.. non riesco a immaginare un caso d'uso professionale che mi porterebbe a usare un LLM che genera un contenuto che riproduce un articolo del NYT (*è solo un esempio*). Esistono utilizzi molto più utili per i quali ha senso usare questa tecnologia.

> Continuo a dirlo: è fondamentale trovare risposte a queste domande e trovare **linee condivise globalmente** per creare, addestrare e usare questi modelli e le architetture più evolute che verranno.

[‘Impossible’ to create AI tools like ChatGPT without copyrighted material, OpenAI saysPressure grows on artificial intelligence firms over the content used to train their products![](https://assets.guim.co.uk/static/frontend/icons/homescreen/apple-touch-icon-512.png)The GuardianDan Milmo![](https://i.guim.co.uk/img/media/ca6af0b84989aedf106fbbbce585433f792443f7/0_0_4276_2566/master/4276.jpg?width=1200&height=630&quality=85&auto=format&fit=crop&overlay-align=bottom%2Cleft&overlay-width=100p&overlay-base64=L2ltZy9zdGF0aWMvb3ZlcmxheXMvdGctZGVmYXVsdC5wbmc&enable=upscale&s=68592d4ac11bfd5b135699b8057eeda6)](https://www.theguardian.com/technology/2024/jan/08/ai-tools-chatgpt-copyrighted-material-openai?ref=alessiopomaro.it)

---

## **Un motore di ricerca sfruttando Vertex AI**

Come si può creare un motore di ricerca interno con [**Vertex AI Search**](https://cloud.google.com/vertex-ai-search-and-conversation?hl=it&ref=alessiopomaro.it)?  
È abbastanza semplice..

- Si crea un'app all'interno del pannello di Vertex AI Search.
- Si specificano gli URL sui quali effettuare la ricerca.
- Si crea una pagina web con il widget all'interno.
- Si distribuisce, localmente o pubblicamente attraverso un Cloud Storage Bucket.

> Il post presenta una guida per eseguire gli step, ed è una soluzione davvero interessante.

[Custom Search with Vertex AI SearchThe easy way to get a web page with search scoped to your choice of URLs![](https://cdn-static-1.medium.com/_/fp/icons/Medium-Avatar-500x500.svg)MediumMark Ryan![](https://miro.medium.com/v2/resize:fit:1024/1*dH4zxV3X4E0hC_njC3VWBA.jpeg)](https://markryan-69718.medium.com/custom-search-with-vertex-ai-search-a3a8ba53f751?ref=alessiopomaro.it)

---

## [**Mixtral 8x7b**](https://mistral.ai/news/mixtral-of-experts/?ref=alessiopomaro.it) **su un Colab gratuito.. quanto sarebbe performante?**

Ho provato a farlo, e nel video si può vedere la velocità: ho generato circa **330 token in poco più di 5 minuti**.  
Direi che è abbastanza lento, ma non è male per un sistema **gratuito**!

**NOTA**: nel Colab non uso le API, ma clono il modello che funziona direttamente nell'ambiente.

> Il modello: [https://mistral.ai/news/mixtral-of-experts/](https://mistral.ai/news/mixtral-of-experts/?ref=alessiopomaro.it)  
> Per fare dei test: [https://github.com/dvmazur/mixtral-offloading](https://github.com/dvmazur/mixtral-offloading?ref=alessiopomaro.it)

Mixtral 8x7b su un Colab gratuito

---

## **La discussione tra OpenAI e il Times continua**

Secondo **OpenAI**, l'addestramento di modelli di AI utilizzando dati disponibili al pubblico nel web, inclusi articoli come quelli del **Times**, sarebbe "*fair use*".  
"*We view this principle as fair to creators, necessary for innovators and critical for U.S. competitiveness*".

> Tra quanto diventerà chiaro che non basta un tribunale per delineare la strada per il futuro di questa evoluzione tecnologica?

[OpenAI claims New York Times copyright lawsuit is without merit | TechCrunchOpenAI has published a public response to The New York Times’ lawsuit against it over copyright, claiming that the case is without merit.![](https://techcrunch.com/wp-content/uploads/2015/02/cropped-cropped-favicon-gradient.png?w=192)TechCrunchKyle Wiggers![](https://techcrunch.com/wp-content/uploads/2023/11/openAI-pattern-04.jpg?resize=1200,675)](https://techcrunch.com/2024/01/08/openai-claims-ny-times-copyright-lawsuit-is-without-merit/?ref=alessiopomaro.it)

---

## **AI Generativa e copyright: sarà un campo minato? Certo che sì!**

E tutti sapevano che prima o poi avremmo dovuto attraversarlo.  
**Gary Marcus** e **Reid Southen** stanno facendo un grande lavoro di documentazione e riflessione su questa tematica.

- Il problema sollevato: i **LLM** sono in grado di riprodurre fedelmente contenuti protetti da **copyright**, anche senza prompt specifici.
- Manca trasparenza sui **dati di training** da parte dei brand che sviluppano i modelli.
- Si potrebbero ri-addestrare i modelli senza dati che violano il copyright, ma con quali costi?
- Si potrebbero filtrare le richieste, ma sarebbe insufficiente e impreciso.

> È davvero necessario affrontare queste sfide prima possibile per poter governare al meglio questa tecnologia.

[Generative AI Has a Visual Plagiarism ProblemExperiments with Midjourney and DALL-E 3 show a copyright minefield![](https://assets.rebelmouse.io/eyJhbGciOiJIUzI1NiIsInR5cCI6IkpXVCJ9.eyJpbWFnZSI6Imh0dHBzOi8vYXNzZXRzLnJibC5tcy8yNjU5NjY0OS9vcmlnaW4ucG5nIiwiZXhwaXJlc19hdCI6MTcyMjY3NDUwNn0.E9lMSNv23A_GyW60aP_Rh5AzMMAKAHMpGrotgTDO5_Q/img.png?width=192&height=192)IEEE SpectrumGary Marcus![](https://spectrum.ieee.org/media-library/a-grid-of-9-images-produced-by-generative-ai-that-are-recognizable-actors-and-characters-from-movies-video-games-and-televisio.jpg?id=51011919&width=1200&height=600&coordinates=0%2C110%2C0%2C110)](https://spectrum.ieee.org/midjourney-copyright?ref=alessiopomaro.it)

---

## **DocLLM: il modello di linguaggio di JPMorgan**

[**JPMorgan**](https://www.jpmorgan.com/global?ref=alessiopomaro.it) ha lanciato **DocLLM**, un LLM in grado di elaborare documenti, fatture, documenti finanziari e contratti.  
Il modello è in grado di elaborare sia gli elementi testuali che la disposizione spaziale nei file, consentendo due vantaggi:

- evita l'uso di costosi codificatori di immagini;
- riesce a elaborare strutture di documento eterogenee.

> Le performance rilevate sono molto elevate.  
> Il paper: [https://arxiv.org/abs/2401.00908](https://arxiv.org/abs/2401.00908?ref=alessiopomaro.it)

![DocLLM, un LLM di JPMorgan](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/01/modello-LLM-JPMorgan.webp)

DocLLM, un LLM di JPMorgan

---

## **OpenVoice: un modello open source per la clonazione della voce**

**OpenVoice** è il nuovo modello open source dedicato alla **clonazione della voce** sviluppato da MIT, Tsinghua University e MyShell.  
Il processo è quasi istantaneo, con un controllo granulare del tono, dall’emozione all’accento, al ritmo, alle pause e all’intonazione. Il tutto con un piccolo clip audio in input.  
Si basa su due modelli di **Deep Learning** complementari: un **text-to-speech (*TTS*)** e un “*convertitore di tono*”. Il primo è stato addestrato su 30k frasi audio, annotando ogni campione con emozioni, intonazione e ritmo. Il secondo è stato allenato su oltre 300k campioni vocali. In entrambi i casi, l’audio originale è stato scomposto in fonemi, i suoni distintivi del linguaggio, e rappresentato tramite vettori ([***embeddings***](https://www.alessiopomaro.it/embeddings-gpt4-clusterizzare-ai/)) processabili da un algoritmo.

> Il paper: [https://arxiv.org/abs/2312.01479](https://arxiv.org/abs/2312.01479?ref=alessiopomaro.it), ma il modello è già usabile su HuggingFace.

OpenVoice: un modello open source dedicato alla clonazione della voce

---

## **Ferret: il modello generativo di Apple**

E anche **Apple** entra nella corsa frenetica dell'**AI Generativa** con **Ferret**, un **modello multimodale** **open source** presentato in sordina a ottobre.  
Sì, "*Apple*" e "*open source*" nella stessa frase.. Una campagna per promuovere un'**AI etica**? Una tattica per ottenere un vantaggio competitivo? La consapevolezza che si tratta dell'unica via possibile? Forse la verità combina tutte queste le componenti.  
Resta il fatto che si tratta di un modello potente, con **approcci innovativi** e con intuizioni per sfruttare un hardware meno potente.

> Ci sarà un assistente virtuale all'avanguardia nel prossimo iPhone?

- Sembra avere **performance elevate in ambito visivo**. Superiori a **Vision** di OpenAI, pur essendo molto più piccolo. Come?
- Oltre a processare l'intera immagine, può concentrarsi su elementi dell'immagine stessa, in modo da conoscerne il contenuto in modo rapido ed efficiente.
- Lavora **come farebbe un essere umano che guarda una foto**: non processa i singoli pixel, ma riconosce determinati elementi, e grazie a questi ha subito la conoscenza del contenuto.

> L'evoluzione di questi sistemi è sempre più affascinante.

[GitHub - apple/ml-ferretContribute to apple/ml-ferret development by creating an account on GitHub.![](https://github.githubassets.com/assets/pinned-octocat-093da3e6fa40.svg)GitHubapple![](https://opengraph.githubassets.com/34f10197793306e108758ccbaa80a7af4da6d2ddf9490db541bf20cb1b9154c0/apple/ml-ferret)](https://github.com/apple/ml-ferret?ref=alessiopomaro.it)

---

## **Infinity: un nuovo database per sistemi RAG**

Il concetto di **RAG *(Retrieval-Augmented Generation)*** mette insieme un LLM e un archivio di informazioni per ottenere **estrazione ed elaborazione di dati** in modo performante.  
**Infinity** è una nuova tipologia di database progettato appositamente per questi sistemi.  
Non si tratta di un **database vettoriale**, ma di un concetto che combina la ricerca full-text, la ricerca vettoriale *(anche su più colonne)* e su dati strutturati.  
È estremamente veloce, e fornisce diverse interfacce (es. API Python e SQL).

> Non solo i LLM si evolvono velocemente, ma anche le strutture dati per generare il contesto.

[GitHub - infiniflow/infinity: The AI-native database built for LLM applications, providing incredibly fast vector and full-text searchThe AI-native database built for LLM applications, providing incredibly fast vector and full-text search - GitHub - infiniflow/infinity: The AI-native database built for LLM applications, providin…![](https://github.githubassets.com/assets/pinned-octocat-093da3e6fa40.svg)GitHubinfiniflow![](https://opengraph.githubassets.com/213efe014a3aae7616528ec07dbbb109668bdc017d4ea4a259bdc569970db736/infiniflow/infinity)](https://github.com/infiniflow/infinity?ref=alessiopomaro.it)

---

## **Che tipo di bolla è l'AI?**

Titolo provocatorio, ma anche un saggio che tutti coloro che si occupano di **Intelligenza Artificiale** dovrebbero leggere.  
Su diversi passaggi non sono pienamente allineato, ma fa capire quanto è importante guardare oltre, e **implementare soluzioni agili**, ancorate a processi solidi che vengono accelerati e ampliati grazie alla tecnologia.

[Cory Doctorow: What Kind of Bubble is AI?Of course AI is a bubble. It has all the hallmarks of a classic tech bubble. Pick up a rental car at SFO and drive in either direction on the 101 – north to San Francisco, south to Palo Alto – and …![](https://locusmag.com/wp-content/uploads/2017/10/LocusRocketLogo.jpg)Locus Onlinelocusmag![](https://locusmag.com/wp-content/uploads/2017/05/Cory2017_800x400.jpg)](https://locusmag.com/2023/12/commentary-cory-doctorow-what-kind-of-bubble-is-ai/?ref=alessiopomaro.it)

---

## **La funzionalità "Realtime Gen" di Leonardo AI**

Anche [**Leonardo AI**](https://leonardo.ai/?ref=alessiopomaro.it) sta lavorando al concerto di **generazione di immagini** in real time.  
Nel video una piccola dimostrazione della nuova funzionalità denominata "***Realtime Gen***", che genera l'immagine mentre scrivo il prompt.

> Sembra un esercizio di stile, ma pensiamo a come cambierà la **UX** delle piattaforme quando l'esperienza potrà **cambiare in tempo reale** in base ai dati degli utenti.

"Realtime Gen" di Leonardo AI

---

## **Google presenta VideoPoet: un modello generativo dedicato ai video** 

**Google** ha recentemente presentato **VideoPoet**, un modello in grado di generare/editare video a partire da **prompt multimodali**.  
Questo non stupisce più, ma si tratta di un sistema non basato sulla **diffusione**. È una generazione video prodotta da un singolo LLM.  
Una nuova tecnica che non implica componenti addestrati separatamente, e specializzati in ciascuna attività.

> I sistemi migliorano, e diventano più efficienti, introducendo diversi vantaggi.

[VideoPoet: A large language model for zero-shot video generation![](https://blog.research.google/favicon.ico)Google ResearchPosted by Dan Kondratyuk and David Ross, Software Engineers, Google Research![](https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEjFG8pxLk-uvJVPesDUxU7Ox7Tb0VR4lB4jNygxiiIl9gyeX-rgtCb5jhWbPDKGad4d5GkPFr7-uzdZOngFtnPbmV6IurKEd5vHTiLesCvx8RDzBy_5u31e6C93kuirOG8pKcwEBkBrw4TBTzh3WIoX1TZYzYM3M4aj4zYD2r_p5FflI7ntpqoD9fsGQhwO/w1200-h630-p-k-no-nu/videopoetpreview.gif)](https://blog.research.google/2023/12/videopoet-large-language-model-for-zero.html?ref=alessiopomaro.it)

---

## \- GRAZIE -

Se hai apprezzato il contenuto, e pensi che potrebbe essere utile ad altre persone, condividilo 🙂

## Iscriviti alla Newsletter

Un appuntamento periodico dedicato all'aggiornamento e alla riflessione su tematiche relative all'intelligenza artificiale.

Iscriviti alla Newsletter 

Email sent! Check your inbox to complete your signup. 

Gratuita. No Spam. Puoi disiscriverti quando vuoi.Consulta la [privacy policy](https://www.alessiopomaro.it/privacy-policy/).