> ## Content Index
> Fetch the complete content index at: https://www.alessiopomaro.it/llms.txt
> Use this file to discover other available public pages before exploring further.

# Generative AI: novità e riflessioni - #10 / 2024
- URL: https://www.alessiopomaro.it/generative-ai-novita-riflessioni-10-2024/
- Published: 2024-11-06T06:23:31.000Z
- Updated: 2024-11-28T15:08:56.000Z
- Description: Come funziona Canvas di OpenAI? Un GPT che lavora come "o1" è possibile? CORSI, TEST e RISORSE gratuite, la data analysis con o1 e i bias dei modelli di linguaggio. Novità su Flux 1.1 e l'addestramento con immagini personalizzate. Tutte le novità da Google, Meta, Anthropic, Runway, e molto altro.
- Author: Alessio Pomaro
- Tags: AI, GPT, Gemini, Novità e Riflessioni

> **Buon aggiornamento, e buone riflessioni..**

---

## **\[corso\] AI per agenzie e team digital**

Una giornata di formazione e un'opportunità unica per approfondire l'intersezione tra l'AI e il mondo del **marketing**, dal **Prompt Engineering** alle declinazioni dell'AI nella **SEO**, e i casi pratici nell'**advertising** e nel mondo **copy**.

> Dalle basi alle applicazioni pratiche

[![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/ai-agenzie-team-digital-novembre-alessio-pomaro.webp)](https://accademia.searchon.it/next/events/ai-per-agenzie-team-digital/?utm%5Fsource=alessiopomaro.it&utm%5Fmedium=newsletter&utm%5Fcampaign=accademia24-aipergenzie)

Scopri il **programma completo** e l’offerta sul biglietto.

[Vai al corso](https://accademia.searchon.it/next/events/ai-per-agenzie-team-digital/?utm%5Fsource=alessiopomaro.it&utm%5Fmedium=newsletter&utm%5Fcampaign=accademia24-aipergenzie)

---

## **\[corso gratuito\] Generative AI for beginners**

**Microsoft** rilascia la terza versione del corso "***Generative AI for beginners***".  
21 **lezioni gratuite** dedicate allo sviluppo di applicazioni basate sui LLM.  
Le lezioni sono etichettate: "*Learn*" per i concetti, mentre "*Build*" per esempi di codice (*Python e TypeScript*).

![Generative AI for beginners](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/generative-AI-for-beginners-microsoft.webp)

Generative AI for beginners

Il corso fornisce istruzioni anche su come **configurare un ambiente di sviluppo**.

> Un'ottima risorsa, fin dalla prima versione.

[Vai al corso](https://microsoft.github.io/generative-ai-for-beginners/?ref=alessiopomaro.it)

---

## **Canvas di OpenAI**

Ho provato il nuovissimo "**Canvas**" di OpenAI: un'interfaccia di ChatGPT che consente di lavorare su testi e codice con funzionalità di editing e "*trasformazione*".  
Nei testi, è possibile **affinare il contenuto** (*grammatica, chiarezza, coerenza*), **cambiare il livello di lettura**, aggiustare la lunghezza, ottenere **suggerimenti di miglioramento** e aggiungere emoji pertinenti.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-3.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-4.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-5.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-6.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/canvas-openai-7.webp)

Test di Canvas di OpenAI

Nel codice, possiamo revisionare, aggiungere i commenti, i log, fixare i bug, eseguire il **porting ad un altro linguaggio**.

> In entrambe le modalità, possiamo selezionare un blocco e applicate un prompt specifico alla selezione.

### **Non una semplice interfaccia.. ma un editor!**

> Non si tratta solo di un'interfaccia con nuove funzionalità, ma anche **un EDITOR a tutti gli effetti**. 

Questo significa che è possibile **lavorare sui contenuti** direttamente dalla piattaforma, collaborando con un assistente.

Canvas di OpenAI non è solo una nuova interfaccia

Nel video, un piccolo esempio in cui genero una bozza, faccio modifiche insensate dall'editor, e infine applico la rifinitura. Come si vede **il sistema corregge tutti i miei errori** e i contenuti fuori contesto.

> Uno strumento straordinario, per l'utilizzo di questi sistemi come "assistente personale".

---

## **Un GPT che si comporta come "o1" di OpenAI, con risultati simili**

Ho fatto eseguire diversi task della [presentazione di **o1 di OpenAI**](https://openai.com/o1/?ref=alessiopomaro.it) al mio GPT addestrato per comportarsi allo stesso modo (*eseguendo catene di pensiero - CoT*).  
I prompt sono identici, e i risultati sono ottimi. Nel video si vedono alcuni esempi che nella presentazione sono stati definiti "***Reasoning***", "***Logic Puzzles***", "***HTML Snake***", e "***coding***".

Un GPT che si comporta come "o1" di OpenAI, con risultati simili

Ho fatto questo test per dimostrare come questa modalità può essere utile per **migliorare le performance anche di altri LLM**, quando per le risposte servono passaggi logici.

> Attenzione: **"o1" non è solo questo**. Ha un addestramento specifico per sviluppare CoT, e quella che vediamo negli step di ragionamento, non è l'unica CoT che genera (la documentazione lo spiega chiaramente). Ma è uno spunto interessante per migliorare i prompt.

---

## **L'analisi dei dati con o1**

Anche se **o1** di OpenAI non ha accesso a file esterni, possiamo usare un altro modello per analizzarli, per poi usare l'elaborazione di o1.  
Nell'esempio, uso **GPT-4o** per descrivere il dataset, fornendo anche suggerimenti per la pulizia dei dati.  
Questo diventa **il contesto per il prompt su o1**, attraverso il quale ho generato il codice Python per creare un piccolo **modello predittivo** sul dataset.  
Dopo alcune interazioni e revisioni, il sistema fa predizioni con un errore medio inferiore al 15%.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/o1-analisi-dati-python-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/o1-analisi-dati-python-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/o1-analisi-dati-python-3.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/o1-analisi-dati-python-4.webp)

Un test di analisi dei dati usano o1 si OpenAI

> Il potenziale di o1 è davvero notevole. Durante tutte le interazioni, **non ho mai ottenuto un solo errore nella console Python**.

---

## **\[test\] I bias dei modelli di linguaggio**

Ho fatto un piccolo test usando gli [**embeddings**](https://www.alessiopomaro.it/embeddings-gpt4-clusterizzare-ai/) di OpenAI per verificare la presenza di **bias** evidenti.  
Ho usato **text-embedding-3-large** (*la rappresentazione più ampia*), termini in inglese, e similarità del coseno per il confronto.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/bias-llm-test-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/bias-llm-test-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/bias-llm-test-3.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/bias-llm-test-4.webp)

Un test sui bias dei LLM

- C'è **sbilanciamento di genere**, ma moderato. Solo per il termine "*nurse*" è significativo.
- C'è **sbilanciamento quasi unidirezionale di razza**, ma generalmente moderato.

> È un test molto limitato, ma credo sia interessante esplorare questi aspetti della **rappresentazione dei modelli**. Fa capire, inoltre, la meraviglia di questi strumenti in grado di **"comprendere" anche sfumature complesse del linguaggio**.

---

## **\[test\] Il "*code interpreter*" di Anthropic**

Anche **Anthropic** introduce su **Claude** una sorta di **code interpreter** in grado di **sviluppare ed ESEGUIRE codice JavaScript** per dare risposte agli utenti.  
Può fare calcoli complessi e analizzare dati, e usa [**Artifacts**](https://support.anthropic.com/en/articles/9487310-what-are-artifacts-and-how-do-i-use-them?ref=alessiopomaro.it) per la visualizzazione.  
Nelle immagini si può vedere in un piccolo test che ho fatto.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/code-interpreter-anthropic-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/code-interpreter-anthropic-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/code-interpreter-anthropic-3.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/code-interpreter-anthropic-4.webp)

Il "code interpreter" di Anthropic

> Chissà perché hanno scelto **JavaScript** come linguaggio.. forse perché è più orientato a generare un'interfaccia interattiva, ma preferisco la scelta di OpenAI di usare **Python** per l'analisi e lo sviluppo, per poi agganciare l'interattività al front end.

---

## **Flux 1.1 \[pro\] "*blueberry*"**

**Black Forest Labs** a rilascia **Flux 1.1 \[pro\] "*blueberry*"**, e la beta delle API.  
Una release che, secondo Black Forest Labs, segna in passo in avanti significativo nell'ambito della generazione delle immagini.  
L'ho provato, e la qualità è oggettivamente sempre migliore.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/flux-1.1-pro-1-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/flux-1.1-pro-2-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/flux-1.1-pro-3-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/flux-1.1-pro-4.webp)

Immagini generate con Flux 1.1 Pro

> **6 volte più veloce**, più aderente al prompt e con qualità di immagine superiore. È già primo nell'Artificial Intelligence Image Arena.

### Come provare Flux 1.1 Pro per la generazione di immagini

- Attraverso le API di Black Forest Labs: [https://docs.bfl.ml/](https://docs.bfl.ml/?ref=alessiopomaro.it)
- Su FAL: [https://fal.ai/models/fal-ai/flux-pro/v1.1](https://fal.ai/models/fal-ai/flux-pro/v1.1?ref=alessiopomaro.it).
- Su Replicate: [https://replicate.com/black-forest-labs/flux-1.1-pro](https://replicate.com/black-forest-labs/flux-1.1-pro?ref=alessiopomaro.it)
- Su Freepik: [https://www.freepik.com/pikaso/ai-image-generator](https://www.freepik.com/pikaso/ai-image-generator?ref=alessiopomaro.it)
- Su Together: [https://api.together.ai/playground/image/black-forest-labs/FLUX.1.1-pro](https://api.together.ai/playground/image/black-forest-labs/FLUX.1.1-pro?ref=alessiopomaro.it)

### Come addestrare Flux con immagini di prodotti e/o soggetti

- Su Flux Labs: [https://www.fluxlabs.ai/](https://www.fluxlabs.ai/?ref=alessiopomaro.it)
- Su Flux AI: [https://www.useflux.ai/](https://www.useflux.ai/?ref=alessiopomaro.it)
- Su Replicate: [https://replicate.com/lucataco/ai-toolkit/train](https://replicate.com/lucataco/ai-toolkit/train?ref=alessiopomaro.it)

> L'evoluzione di questi sistemi è davvero interessante, e merita una sperimentazione.

---

## **\[test\] Flux 1.1 pro + Hailuo AI di MiniMax**

Ho fatto qualche test con **Hailuo AI**, un nuovo prodotto della startup cinese **MiniMax**.  
Ho generato i video partendo da immagini create con **Flux 1.1 Pro**, e aggiungendo prompt testuali per descrivere l'azione.

HailuoAI + #Flux 1.1 Pro + prompt testuale per la generazione video

> La qualità è notevole, ma lo è soprattutto **l'aderenza dei video alla descrizione testuale**. Le azioni dei soggetti sono esattamente quelle che ho descritto negli input.

[Vai al servizio](https://hailuoai.video/?ref=alessiopomaro.it)

---

## **AI Festival - 26 e 27 febbraio 2025**

> "Non esiste innovazione senza integrazione. Serve un lavoro sartoriale, di integrazione nei processi. Ed è proprio chi è a conoscenza dei processi aziendali, potenziato da questa tecnologie, che può cogliere i punti strategici dove l'AI può fare la differenza".

Il 26 e 27 febbraio vi aspetto a Milano per l'AI Festival, dove parleremo di questo, ed esploreremo insieme **il futuro dell'intelligenza artificiale**, scoprendo tutte le novità e tendenze più recenti.

[Scopri l'evento](https://bit.ly/aifestival-2025?ref=alessiopomaro.it)

---

## **Act-One di Runway**

> La nuova funzionalità di Runway è impressionante.

Si tratta di **Act-One**, e consente di creare video con personaggi espressivi attraverso **Gen-3 Alpha** utilizzando un singolo video come guida e un'immagine del personaggio.

È possibile, ad esempio, creare una scena come questa senza attrezzature sofisticate (*nella parte finale del video si può comprendere la tecnica*).

Act-One di Runway: un esempio di utilizzo

> Le potenzialità sono elevate, come la necessità di gestire gli eventuali "utilizzi negativi".

---

## **\[test\] L'evoluzione di Imagen 3 di Google**

Dopo qualche test su **Imagen 3** su **Gemini Advanced**, devo dire che la qualità è cambiata di molto.  
Il livello medio dei modelli di generazione di immagini si sta alzando, ma soprattutto sta crescendo l'**aderenza al prompt**.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/imagen3-gemini-test-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/imagen3-gemini-test-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/imagen3-gemini-test-3.webp)

L'evoluzione di Imagen 3 di Google

> Le immagini sono state generate con istruzioni semplicissime e in italiano.  
> Non permette ancora output in cui sono presenti persone.

---

## **\[test\] Imagen 3 + Hailuo AI di MiniMax + ElevenLabs Sound Effects**

Test di generazione immagini + video + audio.  
Ho generato le immagini attraverso **Imagen 3** di Google (*Text-To-Image*), i video con **MiniMax** (*Image-To-Video*), l'audio con **ElevenLabs Sound Effects** (*Text-To-Audio*).

Imagen 3 + Hailuo AI di MiniMax + ElevenLabs Sound Effects

> Ancora una volta, non è tanto la qualità a stupirmi, ma l'aderenza degli output ai prompt.

Spesso la domanda è: quanto tempo serve per generare gli output? Pochi minuti. Ma la vera domanda è: **come avrei potuto crearli senza questi mezzi!?**

---

## **AI Assistant su Chrome DevTools**

**AI Assistant** è una nuova funzionalità sperimentale di **Chrome DevTools** davvero notevole.  
Permette di usare **Gemini** per applicare prompt alla pagina web o a elementi specifici, per spiegazioni o **suggerimenti di implementazione**, con la possibilità di applicarli direttamente.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/ai-assistant-chrome-devtools-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/ai-assistant-chrome-devtools-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/ai-assistant-chrome-devtools-3.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/ai-assistant-chrome-devtools-4.webp)

AI Assistant su Chrome DevTools

Nelle immagini lo uso per fare alcune azioni che modificano la pagina, con generazione di JS e CSS. Creo il bottone per la "*dark mode*".

[Vai alla documentazione](https://developer.chrome.com/docs/devtools/ai-assistance?ref=alessiopomaro.it)

---

## **Advanced Voice Mode di ChatGPT**

Prime impressioni sull'**Advanced Voice Mode** di ChatGPT..

- Anche se sono stati fatti grandi passi, in italiano, non siamo ancora a livelli di fluidità della versione USA.
- Il comportamento dell'agente non è il massimo: per una "*chiacchierata*", un mio GPT addestrato per questo scopo, dà un'esperienza migliore. Infatti, quando questa modalità sarà attiva **anche per GPT custom**, tutto diventerà molto più interessante. Ricordate le applicazioni vocali di **Alexa** e **Google Assistant**?
- Non accede al web per reperire informazioni.
- L'interruzione del parlato dell'assistente, non funziona benissimo, ma credo sia una questione di hardware.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/chatgpt-advanced-voice-mode-considerazioni-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/chatgpt-advanced-voice-mode-considerazioni-2.webp)

Advanced Voice Mode di ChatGPT

> Insieme a **Gemini Live**, siamo di fronte a **un nuovo capitolo dell'interazione vocale**. Un salto importante rispetto al precedente, ma il percorso verso la naturalezza non è concluso.

---

## **Atlas di Boston Dynamics**

**Boston Dynamics** ha pubblicato un video impressionante sull'evoluzione di Atlas, il suo **robot umanoide**.  
E specifica che le azioni NON sono pre-programmate o teleguidate: il robot esegue le azioni di spostamento dei componenti **autonomamente**, eseguendo un compito.

L'evoluzione di Atlas Boston Dynamics

Il tutto, due settimane dopo l'accordo epocale dell'azienda (*di proprietà di *Hyundai**) con **Toyota Research Institute**.

> Questa partnership è un esempio di due aziende con una solida base di ricerca e sviluppo che si uniscono per lavorare su molte sfide complesse, e costruire robot utili che risolvono problemi del mondo reale.

---

## **Spark di GitHub Copilot**

Non solo **GitHub Copilot** integrerà tutti i LLM più potenti, che gli sviluppatori potranno scegliere anche in base alle attività (**Claude 3.5 Sonnet* di Anthropic, *Gemini 1.5 Pro* di Google, *GPT-4o* e *o1* di OpenAI*), ma è stato presentato anche **Spark**: uno strumento per creare applicazioni interamente in linguaggio naturale.

Spark di GitHub Copilot

Gli "***spark***" sono micro app completamente funzionali che possono integrare funzionalità AI e fonti di dati esterne.

[Vai al post](https://github.blog/news-insights/product-news/bringing-developer-choice-to-copilot/?ref=alessiopomaro.it)

---

## **SynthID-Text di Google DeepMind**

**SynthID-Text** di **Google DeepMind** è un nuovo metodo per aggiungere una filigrana ai testi generati da LLM, senza degradare la qualità dell'output.  
Il sistema, che ha come obiettivo quello di **riconoscere i testi generati**, è stato reso open-source per proporre uno standard di integrazione.  
La filigrana, successivamente può essere rilevata da un algoritmo.

![SynthID-Text di Google DeepMind](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/11/synth-id-text-google-deepmind.webp)

Qual è il problema!? Una rielaborazione o una traduzione invalideranno la filigrana.

> Il percorso per sistemi di questo tipo è necessario, ma rimane lungo e difficile, con **soluzioni ancora fragilissime**.

[Vai al paper](https://www.nature.com/articles/s41586-024-08025-4?ref=alessiopomaro.it)

---

## **Microsoft introduce gli agenti autonomi in Copilot Studio**

Grazie a questa funzionalità, i developer possono creare assistenti in grado di usare dati di diverse fonti (*es. Microsoft 365 Graph, Dataverse e Fabric*), e di **automatizzare i processi aziendali**.

Gli agenti autonomi in Copilot Studio

Gli agenti operano autonomamente su **attività ripetitive o complesse**, consentendo di **ridurre i tempi di esecuzione e i costi**, migliorando al contempo l'efficienza complessiva.

[Vai al post](https://blogs.microsoft.com/blog/2024/10/21/new-autonomous-agents-scale-your-team-like-never-before/?ref=alessiopomaro.it)

---

## **Computer Use di Anthropic**

**Anthropic** introduce la funzionalità "***Computer Use***" con i nuovi modelli 3.5.  
La nuova capability è sperimentale e consentirà a **Claude** di interagire con un dispositivo via API (*muovere il cursore, cliccare, digitare, ecc.*). Sarà disponibile nei prossimi mesi.

[Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 HaikuA refreshed, more powerful Claude 3.5 Sonnet, Claude 3.5 Haiku, and a new experimental AI capability: computer use.![](https://www.anthropic.com/images/icons/apple-touch-icon.png)![](https://cdn.sanity.io/images/4zrzovbb/website/80e83b2423639e5b10a75109cc99e77db7e2a949-2400x1260.png)](https://www.anthropic.com/news/3-5-models-and-computer-use?ref=alessiopomaro.it)

I nuovi modelli Sonnet e Haiku 3.5 hanno performance migliori, raggiungendo la versione Opus in alcune funzioni.

> Sono molto curioso delle applicazioni che nasceranno dalla possibilità di **interfacciarsi con i device**.

---

## **Le versioni quantizzate per Llama 3.2**

Meta ha lanciato versioni quantizzate di **Llama 3.2** 1B e 2B, progettate per funzionare direttamente sui **dispositivi mobile**.  
Consentono l'implementazione diretta su smartphone e tablet con performance comparabili alle versioni più grandi.  
Alcuni dati di performance: **velocità maggiore di 2-4 volte*, riduzione delle dimensioni del 56%, *riduzione del 51% dell'uso di memoria**.

[Introducing quantized Llama models with increased speed and a reduced memory footprintAs our first quantized models in this Llama category, these instruction-tuned models retain the quality and safety of the original 1B and 3B models, while achieving 2-4x speedup.![](https://static.xx.fbcdn.net/rsrc.php/v3/y4/r/WUJbsVI4ruF.png)![](https://scontent.xx.fbcdn.net/v/t39.2365-6/464303495_1293050525196145_4189921653081247074_n.png?_nc_cat=105&ccb=1-7&_nc_sid=e280be&_nc_ohc=FS8sw-C4At0Q7kNvgGShPOM&_nc_zt=14&_nc_ht=scontent.xx&_nc_gid=AclVxOQkUERY1PRiGgycxe-&oh=00_AYCSbOiVi9X56ErvoOEntyNkMFGxKwyyJIxzdGsMivOpUA&oe=67449348)](https://ai.meta.com/blog/meta-llama-quantized-lightweight-models/?ref=alessiopomaro.it)

> I **modelli piccoli** diventano sempre più interessanti per gli sviluppi in locale sui device, con una competizione al pari dei modelli più grandi.

---

## **Multimodal Embed 3 di Cohere**

[**Cohere**](https://cohere.com/?ref=alessiopomaro.it) lancia una novità davvero interessante: un nuovo modello di AI che crea uno **spazio di incorporamento unificato per testo e immagini**.  
Si chiama **Multimodal Embed 3**, e consente il confronto diretto tra testo e contenuto visivo senza pipeline di elaborazione separate.  
Immaginiamo, ad esempio, le potenzialità nella ricerca in ambito **e-commerce** combinando query visive e testuali, oppure nel **recupero delle informazioni** da una knowledge.

[Introducing Multimodal Embed 3: Powering AI SearchCohere releases a state-of-the-art multimodal AI search model unlocking real business value for image data.![](https://cohere.com/apple-touch-icon.png)Cohere![](https://cohere.com/_next/image?url=https%3A%2F%2Fcohere-ai.ghost.io%2Fcontent%2Fimages%2F2024%2F10%2FEmbed-Multi-Modal-Hero.png&w=640&q=100)](https://cohere.com/blog/multimodal-embed-3?ref=alessiopomaro.it)

> Più si evolve questa capacità di rappresentazione attraverso gli **embeddings**, e più la ritengo una piccola opera d'arte tecnologica.

---

## **Firefly Video: l'integrazione su Premiere Pro**

**Adobe**, durante la conferenza [**MAX**](https://www.adobe.com/max.html?ref=alessiopomaro.it) ha presentato **Firefly Video**, e l'integrazione su **Premiere Pro**.  
La funzionalità "***Generative Extend***", infatti, permette di creare prolungamenti delle clip senza la necessità di di ulteriori riprese.  
Oltre a questo, hanno anche presentato l'[interfaccia web](https://main--blog--adobecom.hlx.page/en/drafts/julia/generate-video-beta-on-firefly-web-app?ref=alessiopomaro.it) per azioni di *Text-To-Video* e *Image-To-Video*.

Firefly Video: l'integrazione su Premiere Pro

> La qualità, ormai, non stupisce più.. ma l'**integrazione nei software più usati dai creator** è una carta vincente.

---

## **L'AI generativa a supporto dell'e-commerce**

L'AI può essere uno strumento utile a mettere in atto **strategie con un effort ridotto**. In questo caso, ha permesso operazioni che sarebbero state insostenibili per il progetto.

![L'AI generativa a supporto dell'e-commerce](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/ai-generativa-ecommerce.webp)

I diagrammi, infatti, mostrano i risultati di **azioni di ottimizzazione su un e-commerce**, basate sui dati, e messe in atto attraverso un LLM.

> Un ingranaggio nei flussi operativi in grado di avvicinare la strategia agli obiettivi.

---

## **La trappola delle allucinazioni dei LLM**

> In realtà, cadere nella trappola delle "***allucinazioni***" che i LLM possono produrre è più facile di quanto si pensi.

Un esempio di allucinazione prodotta da un LLM

Nella prima parte del video, uso **Llama 3.1** senza accesso al web.  
Quindi come genera l'output? Usa il contenuto che ha a disposizione per completare il task: il nome del prodotto, le parole che compongono lo slug dell'URL, e ciò che deriva dal training del modello.

> **È convincente? Insospettabile, direi.. ma fuori controllo! Si tratta di un'allucinazione.**

Nella seconda parte, uso uno scraper che va ad estrarre il testo dall'URL, quindi l'output aderisce alle informazioni nella pagina.

> **Takeaway**: i LLM producono "*allucinazioni*" quando non hanno contesto sufficiente per poter completare il task. È necessario un "contesto controllato".

Serve questa consapevolezza per usarli con maggior sicurezza, e servono strumenti come [**Opik**](https://www.comet.com/site/products/opik/?ref=alessiopomaro.it), o **sistemi multi-agent**, per effettuare test e controlli approfonditi degli output prima di andare in produzione.

---

## **La supervisione umana e il pensiero critico**

Un paper molto interessante di [**Harvard Business School**](https://www.hbs.edu/?ref=alessiopomaro.it) che sottolinea l'importanza di sviluppare competenze di interazione dell'AI nei processi di valutazione creativi che combinano il **giudizio umano** con le intuizioni dell'**Intelligenza Artificiale**.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/harvard-paper-interazione-ai.webp)

Mentre l'AI può standardizzare il processo decisionale per criteri oggettivi, la **supervisione umana** e il **PENSIERO CRITICO** rimangono indispensabili nelle valutazioni soggettive, dove l'AI dovrebbe integrare, non sostituire, il giudizio umano.

[Vai al paper](https://papers.ssrn.com/sol3/papers.cfm?abstract%5Fid=4914367&trk=feed-detail%5Fmain-feed-card%5Ffeed-article-content&ref=alessiopomaro.it)

---

## **Ministral 3B e 8B**

> La competizione sui LLM "*piccoli*" inizia a diventare interessante quanto quella sui modelli "*grandi*".

**Mistral** rilascia due nuovi modelli destinati all'**elaborazione on-device** e a casi d'uso at-the-edge: **Ministral 3B e 8B**.  
Offrono prestazioni avanzate in ambiti come la comprensione del contesto, il "*ragionamento*" e l'efficienza, con contesti fino a 128k token.  
Sono pensati per applicazioni come **traduzione on-device**, **assistenti intelligenti offline** e **robotica autonoma**.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/ministral-mistral-performance-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/ministral-mistral-performance-2.webp)

Ministral 3B e 8B: performance

Le performance sono migliori rispetto ai concorrenti, con un'attenzione particolare alla privacy e alla latenza ridotta.

[Vai al post](https://mistral.ai/news/ministraux/?ref=alessiopomaro.it)

---

## **State of AI 2024: una sintesi**

Una sintesi dei punti chiave del report "*State of AI*" 2024.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/stste-of-ai-2024-sintesi-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/stste-of-ai-2024-sintesi-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/stste-of-ai-2024-sintesi-3.webp)

State of AI 2024: una sintesi

- **Convergenza delle prestazioni dei modelli**. I modelli open-source, come Llama 3.1 405B, hanno ormai raggiunto le prestazioni dei modelli proprietari. Llama 3.2 espande le capacità in **modalità multimodale**, dimostrando la crescente competitività dei modelli open-source.
- **Avanzamenti dell'AI cinese**. Nonostante le sanzioni statunitensi, i modelli AI cinesi continuano a scalare le classifiche, sfruttando hardware stoccato, accesso cloud e soluzioni alternative. Ciò evidenzia la **resilienza del settore AI cinese**.
- **Miglioramenti in efficienza**. Tecniche di **pruning** e **distillazione** hanno migliorato significativamente l'**efficienza dei modelli** di testo e immagini, mostrando che alte prestazioni possono essere raggiunte con modelli più piccoli e meno dispendiosi.
- **Espansione delle applicazioni AI**. I modelli di linguaggio (*LLMs*) stanno dimostrando capacità in campi scientifici come la progettazione di proteine e l'editing genetico, aprendo nuovi orizzonti per l'AI in biologia e genomica.
- **Sfide per hardware e infrastrutture**. Nvidia continua a dominare l'hardware AI, ma l'incremento della domanda energetica per le infrastrutture AI sta creando pressioni sulle risorse e minacciando gli impegni di sostenibilità delle aziende tecnologiche.

[Vai al report](https://www.stateof.ai/?ref=alessiopomaro.it)

---

## **Movie Gen di Meta**

**Meta** presenta **Movie Gen**, un nuovo modello per la **generazione di video e audio** di alta qualità da **prompt multimodale**.

Le funzionalità principali:

- generazione video da una descrizione testuale;
- video personalizzati;
- editing video;
- generazione di audio (*musica ed effetti sonori*).

Movie Gen di Meta

È stato **addestrato su dataset pubblici e con licenza**, e punta a diventare un riferimento per registi e i **content creator**.

[Vai al post](https://ai.meta.com/blog/movie-gen-media-foundation-models-generative-ai-video/?ref=alessiopomaro.it)

---

## **I nuovi tool di HuggingChat**

**HuggingChat**, oltre alla possibilità di usare i migliori **LLM open source**, mette a disposizione una serie di tool molto interessanti (*es. scraping, analisi dei file, generazione di immagini*).  
Nell'esempio, uso il sistema con **Llama 3.1**, e aggiungo **Flux Realism Lora** per la **generazione di immagini**.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/huggingChat-tools-1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/huggingChat-tools-2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/huggingChat-tools-3.webp)

I nuovi tool di HuggingChat

> Il parco strumenti è molto ampio, e possono essere attivati più tool contemporaneamente.

[Prova il servizio](https://huggingface.co/chat/?ref=alessiopomaro.it)

---

## **Leo AI di Brave**

[**Brave**](https://brave.com/it/?ref=alessiopomaro.it) sta introducendo il suo assistente basato su **AI generativa**: **Leo AI**, che può interagire direttamente con le pagine web che si navigano dal browser.

> Un aspetto interessante, è che il sistema può lavorare con un **LLM locale**, sfruttando [**Ollama**](https://ollama.com/?ref=alessiopomaro.it).

Questo, ad esempio, consente di far elaborare anche **dati personali** al modello, senza che questi lascino il dispositivo.

![Leo AI di Brave](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/leo-ai-brave.webp)

Leo AI di Brave

Sfruttando un hardware [**Nvidia RTX**](https://www.nvidia.com/it-it/geforce/graphics-cards/30-series/?ref=alessiopomaro.it) è possibile ottenere altissime performance anche in locale. Con **Llama 3 8B**, ad esempio, si può ottenere la velocità di **149 token/secondo**.

> L'utilizzo dei LLM in locale è sempre più "possibile".

[Vai al post](https://blogs.nvidia.com/blog/rtx-ai-brave-browser/?ref=alessiopomaro.it)

---

## **Llama Stack di Meta**

**Meta** rilascia un componente davvero interessante: **Llama Stack**.

> Si tratta di un f**ramework open source** per semplificare e standardizzare lo sviluppo e il rilascio di applicazioni basate sui LLM.

Facilita l'integrazione di azioni come **inferenza**, gestione della **memoria**, moderazione / sicurezza.

[GitHub - meta-llama/llama-stack: Model components of the Llama Stack APIsModel components of the Llama Stack APIs. Contribute to meta-llama/llama-stack development by creating an account on GitHub.![](https://github.githubassets.com/assets/pinned-octocat-093da3e6fa40.svg)GitHubmeta-llama![](https://opengraph.githubassets.com/3b104c83ccaebcda2f83cb6b18d62a4c75cd0f01da477891a48fce928a809c2a/meta-llama/llama-stack)](https://github.com/meta-llama/llama-stack?ref=alessiopomaro.it)

Ad esempio, usando le API di inferenza, memoria e sicurezza si possono creare assistenti che rispondono in modo contestuale e sicuro.

> **Standard** e **linee guida** è quello che serve per facilitare l'integrazione di questi sistemi in modo più sicuro ed efficiente.

---

## **Semantic Cache di Redis**

**Semantic Cache di** [**Redis**](https://redis.io/?ref=alessiopomaro.it) è un esempio di componente che permette di ottimizzare le **applicazioni RAG** (*Retrieval Augmented Generation*).

![Semantic Cache di Redis](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/semantic-cache-redis.webp)

Semantic Cache di Redis

È un sistema che salva, vettorializza e indicizza le richieste degli utenti e le risposte. In questo modo, se vengono poste domande simili dal punto di vista semantico, non ci sarà bisogno di usare nuovamente il LLM. 

> Risultato: **abbattimento dei tempi di risposta e dei costi**.

[Vai alla documentazione](https://redis.io/docs/latest/integrate/redisvl/user-guide/semantic-caching/?ref=alessiopomaro.it)

---

## **SciAgents: l'AI al servizio della scoperta scientifica**

**SciAgents** è un sistema di [**Intelligenza Artificiale**](https://www.alessiopomaro.it/tag/ai/) che automatizza la **scoperta scientifica** combinando grafi ontologici della conoscenza, modelli di linguaggio (*LLM*) e **sistemi multi-agent**.  
Ogni agente ha un ruolo specifico, come creare ipotesi, espanderle o criticarle.  
Gli agenti lavorano insieme per esplorare dati scientifici, identificare nuove connessioni e generare proposte di ricerca innovative.

![SciAgents: l'AI al servizio della scoperta scientifica](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/SciAgents-ai-scoperta-scientifica.webp)

Il sistema ha rivelato **relazioni interdisciplinari nascoste** e prodotto **scoperte significative**, superando i metodi di ricerca tradizionali per precisione e scala, accelerando così la scoperta scientifica.

[Vai al paper](https://arxiv.org/abs/2409.05556?ref=alessiopomaro.it)

---

## **DevDay di OpenAI**

Cosa è stato condiviso durante il **DevDay di OpenAI** di San Francisco? 

![Una sintesi del DevDay di OpenAI](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/devday-openai-2024.webp)

Una sintesi del DevDay di OpenAI

Vediamo una sintesi per punti.

- **Realtime API**: consente esperienze di voice-to-voice a bassa latenza, simili a ChatGPT Advanced Voice, con 6 voci preimpostate. Beta disponibile per tutti gli sviluppatori.
- **Prompt Caching**: disponibile per tutti, riduce i costi del 50% e la latenza riutilizzando i token di input recenti.
- **Model Distillation**: nuovo workflow per addestrare modelli più piccoli ed efficienti basati su modelli più grandi. Include Stored Completions ed Evals (*beta*).
- **Vision Fine-Tuning**: possibilità di fine-tuning di **GPT-4o** con testo e immagini, migliorando la **ricerca visiva** e l'**analisi delle immagini**.
- **Aggiornamento di GPT-4o**: nuovo modello gpt-4o-2024-08-06 con costi di input ridotti del 50% e output ridotti del 33%.
- **Disponibilità OpenAI o1**: accesso API esteso ai modelli di ragionamento **o1-preview** e **o1-mini** per gli utenti di livello 3\. Limiti di velocità aumentati per livelli 4 e 5.
- **Generazione nel Playground**: nuovo pulsante "*Generate*" per creare automaticamente prompt, definizioni di funzioni e schemi strutturati.

[Vai al post](https://openai.com/devday/?ref=alessiopomaro.it)

> Il toolkit per l'implementazione di applicazioni basate sui LLM di OpenAI si amplia notevolmente!

---

## **Assistant Editor di LangChain**

[**LangChain**](https://www.langchain.com/?ref=alessiopomaro.it) ha annunciato "***Assistant Editor***", una nuova potente funzionalità di **LangGraph Studio** che rende più facile la configurare e la personalizzazione degli **agenti basati su modelli di linguaggio**.

Assistant Editor di LangChain

Questo strumento di editing visivo consente sia agli sviluppatori che agli utenti non tecnici di mettere a punto il **comportamento degli agenti** senza usare codice.

[Vai al post](https://blog.langchain.dev/asssistant-editor/?ref=alessiopomaro.it)

---

## **Pika 1.5**

**Pika** presenta la versione 1.5, con clip più lunghe, nuovi effetti, riprese cinematografiche e movimenti più realistici.  
Il video è l'unione di clip di alcuni creator che stanno testando il nuovo modello.

Pika 1.5

> La generazione di video fa costanti passi in avanti, e le clip diventano sempre più usabili in ambito professionale.

[Vai al servizio](https://pika.art/?ref=alessiopomaro.it)

---

## **Edge Runner di Nvidia**

**EdgeRunner** è una nuova tecnologia di **Nvidia** in grado di generare **mesh 3D di alta qualità** con fino a 4.000 facce e una risoluzione spaziale di 512, partendo da immagini e point-clouds.  
Utilizza un innovativo algoritmo di tokenizzazione per comprimere le mesh in sequenze di token 1D, migliorando l'efficienza e la qualità della generazione.

Edge Runner di Nvidia

Il sistema può creare varianti diverse da un singolo input, garantendo una grande varietà di risultati.

> Immaginiamo questi sistemi al servizio di videogiochi e **realtà virtuale (VR)**, effetti speciali e animazione nella produzione cinematografica e televisiva, architettura e design, additive manufacturing e **stampa 3D**, **medicina** e **biotecnologie**.

[Vai al post](https://research.nvidia.com/labs/dir/edgerunner/?ref=alessiopomaro.it)

---

## **Liquid Foundation Models**

**Liquid AI** introduce una nuova architettura per LLM che "*sfida*" i Transformer, superando le performance di Llama 3.2 (*a parità di dimensioni*), con ingombro di memoria ridotto e **maggior efficienza nell'inferenza**.  
Ho provato la versione più grande (*40.3B Mixture of Experts - MoE*) sul mio benchmark di test.

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/liquid-foundation-models--1.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/liquid-foundation-models--2.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/liquid-foundation-models--3.webp)

![](https://storage.ghost.io/c/d7/3a/d73a3886-5e95-4e08-9255-a08eb51bb37b/content/images/2024/10/liquid-foundation-models--4.webp)

Un test del LLM di Liquid AI

> Considerando le dimensioni, il sistema promette benissimo, e ha una velocità degna di nota.

[Prova il modello](https://www.liquid.ai/liquid-foundation-models?ref=alessiopomaro.it)

---

## **Open NotebookLM**

> Continuano a nascere progetti che **trasformano documenti e pagine web in podcast**.

**Open NotebookLM** è un sistema basato su modelli AI open source: **Llama 3.1 405B**, [**MeloTTS**](https://github.com/myshell-ai/MeloTTS?ref=alessiopomaro.it), e [**Bark**](https://github.com/suno-ai/bark?ref=alessiopomaro.it).  
Dall'interfaccia di Hugging Face, è possibile caricare file e specificare URL per creare il contesto al modello.

Un test di Open NotebookLM

Il podcast viene generato dal LLM e ottiene la voce dal TTS.  
La qualità non è enorme, ma è un esempio di applicazione semplice per questo scopo.

[Prova il sistema](https://huggingface.co/spaces/gabrielchua/open-notebooklm?ref=alessiopomaro.it)

---

## \- GRAZIE -

Se hai apprezzato il contenuto, e pensi che potrebbe essere utile ad altre persone, condividilo 🙂

## Iscriviti alla Newsletter

Un appuntamento periodico dedicato all'aggiornamento e alla riflessione su tematiche relative all'intelligenza artificiale.

Iscriviti alla Newsletter 

Email sent! Check your inbox to complete your signup. 

Gratuita. No Spam. Puoi disiscriverti quando vuoi.Consulta la [privacy policy](https://www.alessiopomaro.it/privacy-policy/).