Superare i Limiti dell’AI: Janus-Pro Unifica Comprensione e Generazione

DeepSeek-AI ha recentemente annunciato il rilascio di Janus-Pro, un avanzato framework autoregressivo progettato per unificare la comprensione e la generazione multimodale. Questo modello affronta le limitazioni degli approcci precedenti separando la codifica visiva in percorsi distinti, pur mantenendo un’architettura trasformatore unificata per l’elaborazione. Tale disaccoppiamento allevia il conflitto tra i ruoli del codificatore visivo nella comprensione e nella generazione, migliorando al contempo la flessibilità del framework. huggingface.co

Janus-Pro è costruito sulla base dei modelli DeepSeek-LLM-1.5b e DeepSeek-LLM-7b. Per la comprensione multimodale, utilizza SigLIP-L come codificatore visivo, supportando input di immagini fino a 384 x 384 pixel. Per la generazione di immagini, impiega un tokenizzatore con un fattore di downsampling di 16. Questa configurazione consente al modello di gestire efficacemente sia la comprensione che la generazione di contenuti visivi. arxiv.org

Le prestazioni di Janus-Pro sono state valutate su diversi benchmark. Nel test MMBench per la comprensione multimodale, la variante da 7 miliardi di parametri ha raggiunto un punteggio di 79,2, superando modelli come Janus (69,4), TokenFlow-XL (68,9) e MetaMorph (75,2). Nelle attività di generazione di testo in immagine, Janus-Pro ha ottenuto un’accuratezza complessiva dell’80% nel benchmark GenEval, superando DALL-E 3 (67%) e Stable Diffusion 3 Medium (74%). Inoltre, il modello ha raggiunto un punteggio di 84,19 nel benchmark DPG-Bench, dimostrando la sua capacità di gestire prompt complessi con allineamento semantico intricato. arxiv.org

L’architettura di Janus-Pro è progettata per decodificare la codifica visiva per compiti di comprensione e generazione, garantendo un’elaborazione specializzata per ciascuno. Il codificatore per la comprensione utilizza il metodo SigLIP per estrarre caratteristiche semantiche dalle immagini, mentre il codificatore per la generazione applica un tokenizzatore VQ per convertire le immagini in rappresentazioni discrete. Queste caratteristiche vengono poi elaborate da un trasformatore autoregressivo unificato, che integra le informazioni in una sequenza di caratteristiche multimodali per i compiti successivi. arxiv.org

La strategia di addestramento prevede tre fasi: pre-addestramento prolungato su dataset diversificati, fine-tuning efficiente con rapporti di dati regolati e raffinamento supervisionato per ottimizzare le prestazioni attraverso le modalità. L’aggiunta di 72 milioni di campioni di dati estetici sintetici e 90 milioni di dataset di comprensione multimodale migliora significativamente la qualità e la stabilità dei risultati di Janus-Pro, garantendo affidabilità nella generazione di immagini dettagliate e visivamente accattivanti. arxiv.org

Janus-Pro è disponibile su GitHub sotto licenza MIT, con l’utilizzo del modello regolato dalla DeepSeek Model License. Gli utenti possono fare riferimento al repository per le istruzioni di configurazione. huggingface.c

NEWS AIopenmind su:

#newsChatAIopenmind (1)3D (8)6G (2)Accademia di Comunicazione (4)Acer (1)Adobe (41)Aeronautica (10)Africa (3)Agenti AI (6)Agenti autonomi (1)Agenzia delle Entrate (1)Agenzia Spaziale Europea (ESA) (1)Agenzia viaggi (1)AGI (Intelligenza artificiale generalizzata) (10)AGID (1)Agricoltura (1)Amazon (43)Ambiente (4)AMD (2)Android (6)Animali (6)Animazione (5)Anthropic (28)Anziani (1)App (12)Apple (71)Archeologia (3)Architettura (4)Archivi storici (1)Armi (4)Arredamento interni (2)Arte (30)Assistente vocale (6)Astronomia (2)Asus (2)AT&T (1)Audi (1)Audio (57)Autoapprendimento (1)Avatar (7)Aviazione (1)Avvocati (2)Aziende (20)Banca (4)Bard (3)Biblioteca (1)Bill Gates (2)Bing (9)Biologia (1)Birra (1)Blockchain (2)Boston Dynamics (2)Calcio (2)Canva (7)Cattolicesimo (3)Certificazioni (1)Cesintes (1)chataudio (1)Chatbot IA (53)Chip (3)Cina (73)Cinema (11)Claude (20)Clima (5)CNR (1)Coca-Cola (1)Commercio (2)Commissione Europea (2)Compagnie aeree (1)Computer (5)Computer quantistici (37)Computer Vision (3)Comuni italiani (1)Comunicazione (10)Comunicazioni vocali (2)Concorso bellezza AI (1)Consiglio d'Europa (1)Contabilità (2)Convegno (13)Copilot (6)Copyright (16)Criptovalute (1)Cybersecurity (4)Dalle-2 (3)Dark web (3)Data center (11)Dating (1)Deepfake (3)Design automobilistico (2)Design Industriale (6)Diritti Autore (1)Disney (1)Doppiaggio (1)Drone (1)Droni (1)Dropbox (1)E-commerce (1)eBay (1)Editing fotografico (3)Editoria (13)Email (1)ENEA (2)Esercito (2)Et (0)Etica (149)Europol (2)Eventi (7)Evento (8)Facebook (4)FakeNews (18)Falegnameria (1)Fauna selvatica (1)Film (6)Finanza (12)Finanziamenti Italia (4)Firefly (3)Firefox (1)Fondo Monetario Internazionale (1)Formazione (25)Fotografia (113)Francia (1)Free lance (1)G7 (1)Gaming (1)Garante privacy (21)Giappone (10)Giochi (10)Giornalismo (21)Giustizia (2)Google (359)Governo (7)Governo Italiano (3)Grafica (6)Guerra (14)Guida autonoma (7)Hong Kong (2)Hugging Face (5)IBM (8)Illustrazioni (1)iMessage (1)Immobiliare (1)India (4)Indossabili (4)Influencer (1)Informazione (10)Inghilterra (10)INPS (2)Intel (8)ISO (1)Istruzione (17)Jailbreaking (1)Kamala Harris (1)Lavoro (58)Libri (3)Linguistica computazionale (9)Linkedin (9)Linux (1)Luma AI (1)Maltrattamento infantile (1)Marina (1)Marketing (96)Medicina (36)Mercedes-Benz (1)Meta (109)Metaverso (17)Meteo (1)Microsoft (208)Midjourney (18)Mobilità sostenibile (2)Moda (6)Modelli AI (78)Motori di Ricerca (13)Mozilla (2)Museo (1)Musica (40)NASA (1)Nato (2)Natura (2)Natural Language Processing (2)Nazioni Unite (1)NBA (1)NFT (3)Nvidia (50)Occhiali (7)Occhiali Intelligenti (2)Occhiali Smart (1)Oculistica (1)Odore (1)OMS (1)ONU (1)Open Source (4)OpenAI (305)Opera (13)Opera Browser (1)Oppo (3)Oracle (3)Orologio (1)Parlamento Europeo (4)Patente di guida (1)Pensieri (1)Perplexity (13)Pianeta (2)Plugin (1)Polizia (2)Ponti (1)Presentazioni aziendali (4)Privacy (30)Programmazione (12)Prompt (5)Pubblicazione (1)Pubblicità (19)QR Code (1)Qualcomm (4)Ray-Ban (7)Realtà mista (4)Reddit (7)Relazioni internazionali (2)Relazioni Pubbliche (3)Religione (1)Report (127)Ricerca scientifica (9)Riconoscimento emotivo (1)Risorse online (100)Ristorazione (3)Robotica (51)Runway (13)Salute (7)Samsung (14)Sanità (18)Satelliti (2)Sceneggiatura (1)Semiconduttori (2)SEO (3)Shopping online (4)Sicurezza (27)Sicurezza informatica (78)SMS (1)Snapchat (8)Soccorso (1)Società (12)Software (4)Sport (3)Spotify (5)Stability (4)Stable Animation SDK (1)Stable Diffusion (12)Stampanti (1)Standard (4)Startup (355)streaming live (1)Supercomputer (4)Superintelligenza (3)Sviluppatori (1)Sviluppo sostenibile (1)Synthesia (1)Taiwan (3)Taxi (2)Telecomunicazioni (4)Telegram (3)Televisione (1)Tesla (9)TikTok (11)Torah (1)Traduttore AI (7)Truffa (2)Twitter (13)Ucraina (3)Udito (1)UE (12)UNESCO (2)UNICEF (1)Unione Europea (26)Università (5)Uomo (1)USA (58)Vaticano (4)Video (125)Videocomunicazione (4)Videogiochi (4)Vigili del fuoco (1)Violenza domestica (1)Visualizzazione dati (1)Vodafone (1)Vogue Business - As Gen Z matures (0)Volkswagen (1)VPN (3)Website (12)WhatsApp (11)Wikipedia (1)Wordpress (3)X (12)Xiaomi (1)Yahoo (3)Youtube (17)Zoom (6)



AI open mind

Insieme per riflettere sull’intelligenza - umana e artificiale - tra studi, esperienze, democrazia e innovazione.

#newsETHOS-AIopenmind 2025 Gennaio 30

EU, U.S. in disaccordo sulle normative di sicurezza AI TechTarget L'UE e gli Stati Uniti hanno visioni divergenti sulla regolamentazione della sicurezza dell'intelligenza artificiale, mentre il...

Willow: il chip quantistico di Google che sfida l’eternità

https://www.youtube.com/watch?v=h6w4SX7ZJMQ Google ha annunciato il lancio di Willow, un chip quantistico di ultima generazione che rappresenta un significativo progresso nel campo della computazione quantistica. Con...

DeepSeek-R1 e NVIDIA RTX 50: il futuro del ragionamento AI sui PC locali

L’intelligenza artificiale raggiunge nuovi traguardi con la famiglia di modelli DeepSeek-R1, progettata per eseguire ragionamenti avanzati e risolvere problemi complessi direttamente sui PC degli utenti....

Mi sono imparato la scienza?

Fahrenheit.iit e il potere della narrazione. Mercoledì 13 marzo, ore 17:00 in Accademia di Comunicazione e in streaming Registrati La narrazione può essere la lama...

Iscrizione NEWSLETTER

I dati da Lei forniti non saranno comunicati ad altri soggetti terzi e non saranno trasferiti né in Stati membri dell’Unione Europea né in paesi terzi extra UE.

Visita le sezioni del sito

Link utili

Casi studio, contributi

AI governance: A research agenda, Governance of AI program, Future of Umanity Institute, University of Oxford, Dafoe A., 2017 Artificial intelligence (AI) is a po-tent...

Libri

Ricerche

Piattaforme Corsi Gratuiti

White paper, guidelines