Modelli
Oggi
FBN e Google AI Futures Fund sviluppano un motore AI per le aziende agricole
Farmers Business Network e Google AI Futures Fund svilupperanno una piattaforma di intelligenza artificiale per aiutare le aziende agricole a conduzione familiare a gestire le attività.
Replit Agent sceglie i propri sub-agenti: costi più bassi, risultati migliori
Il nuovo Agent di Replit lascia decidere al modello quando e come delegare i compiti, superando le configurazioni precedenti nei benchmark di ingegneria del software.
NVIDIA Kumo Tabular arriva su Hugging Face in tre versioni
Il modello open foundation per i dati tabellari è ora disponibile su Hugging Face nelle versioni Small, Medium e Large (da 28 a 215 milioni di parametri) e guida quattro importanti benchmark.
ElevenLabs lancia il modello vocale v4: API meno care e Turbo più veloce
Le nuove voci v4 e v4 Turbo costano rispettivamente 0,08 e 0,04 dollari ogni 1.000 caratteri. Fino al 12 ottobre, prezzo promozionale di 0,022 e 0,011 dollari.
Everspin presenta la prima MRAM collegata via CXL
Il produttore di memorie ha mostrato un nuovo modulo MRAM collegato tramite Compute Express Link, che aggiunge un livello persistente e veloce tra DRAM e NAND.
Google porta Gemini 3.8 Flash TTS nelle API
Google ha reso disponibili a tutti, tramite Gemini API, due nuovi modelli di sintesi vocale: Gemini 3.8 Flash TTS e Flash-Lite TTS.
Aleph Alpha addestra un LLM a segnalare le risposte non supportate
Un nuovo addestramento Merlin‑Arthur insegna al modello a dire «non lo so» quando il documento non contiene la risposta, riducendo le allucinazioni fino a 35 punti percentuali.
I modelli di IA cinesi spesso ripetono la linea del Partito, secondo uno studio
Aleph Alpha ha testato 967 prompt politici e ha rilevato risposte faziose nei modelli cinesi. Anche Nemotron di NVIDIA, tuttavia, mostrava alcuni dati allineati alla linea del Partito.
InternLM pubblica su Hugging Face il modello AutoVerifier per valutare le dimostrazioni matematiche
Il nuovo modello esamina dimostrazioni in linguaggio naturale, segnala gli errori e individua il primo passaggio sbagliato, aiutando a valutare i risultati inviati ad AdvancedMathBench.
Aleph Alpha addestra un modello a ragionare in tedesco
Aleph Alpha afferma che circa 800.000 esempi di addestramento in tedesco hanno aiutato un piccolo modello di IA a produrre tracce di ragionamento in tedesco. Il lavoro ha inoltre messo in luce un compromesso: inizialmente i punteggi del modello nei benchmark in tedesco sono calati, in parte perché il modello rimaneva bloccato a ripetere i propri ragionamenti.
Il tuning dei soft prompt aiuta i benchmark per gli LLM a valutare le conoscenze, non il formato
Aleph Alpha dimostra che bastano dieci minuscoli vettori, addestrati per un minuto, per far sì che i modelli di base rispondano nel formato corretto e ottenere valutazioni più chiare.
Confronto tra checkpoint di pre-training con ricetta abbinata
Per ciascun checkpoint, tutte e tre le fasi successive (mid-training, adattamento al contesto lungo e SFT) vengono eseguite con la stessa ricetta di learning rate.
Oracle aggiunge Fusion Claw per automatizzare attività aziendali complesse
Il nuovo runtime Fusion Claw di Oracle consente alle app Fusion di gestire attività articolate in più fasi, come la pianificazione del personale e la contabilità, affidando il ragionamento all’IA e lasciando i calcoli fuori dal modello.
TensorRT-LLM 1.3.0rc29 rimuove AutoDeploy e aggiunge il supporto FP8 per Qwen3.5
La release elimina la funzionalità AutoDeploy e consente di caricare checkpoint Qwen3.5 con scaling FP8 globale.
Mojio cambia nome in Force Fleet e lancia Felix
Mojio annuncia il ritiro del proprio marchio e il passaggio a Force Fleet, una piattaforma di gestione delle flotte per piccole e medie imprese. Il suo nuovo prodotto, Felix, è un gestore di flotte basato sull’intelligenza artificiale; secondo l’azienda, i clienti hanno tracciato oltre 750 milioni di miglia negli Stati Uniti.
Google Research pubblica il framework RRSI per agenti IA capaci di migliorarsi
Lo strumento open source consente agli agenti basati su modelli linguistici di grandi dimensioni di modificare prompt, strumenti e memoria senza cambiare il modello stesso, migliorando i risultati nei benchmark.
Il CEO di Mistral accusa i rivali di negligenza nel dibattito sulla sicurezza dell’IA
Arthur Mensch sostiene che il dibattito negli Stati Uniti sulla sicurezza dell’IA abbia distolto l’attenzione dalle carenze nel controllo degli agenti di IA. Mistral intende continuare a sviluppare modelli avanzati, senza rallentare.
OpenAI sospende il lancio di GPT‑6.1 Astra dopo che i test di sicurezza hanno rilevato comportamenti scorretti
L’azienda ha dichiarato che i test interni hanno mostrato come il nuovo modello potesse agire senza autorizzazione, presentare in modo fuorviante il proprio operato e ignorare i comandi degli utenti. Per questo, il lancio previsto a ottobre è stato annullato.
Cinque schede usate per il mining eseguono Qwen3-Coder-Next a 40 token al secondo
Un utente di Reddit afferma che un cluster di cinque schede BC-250 genera Qwen3-Coder-Next a 40 token al secondo. La configurazione sarebbe costata meno di 800 dollari, ma consuma energia in modo inefficiente.
mu-bench mette alla prova la trascrizione vocale in cinque lingue
I ricercatori hanno presentato un benchmark basato sulle chiamate a un agente bancario basato sull’intelligenza artificiale. Misura se le trascrizioni conservano il significato di ciò che dicono i chiamanti, non soltanto se le parole corrispondono esattamente.
Gli agenti di programmazione possono assemblare testi generati dall’IA per eludere i sistemi di rilevamento
Un nuovo metodo permette agli agenti software di comporre testi usando un modello linguistico più piccolo: il tasso di rilevamento scende dal 77% al 24%, ma il costo delle query può aumentare fino a trenta volte.
Il modello di programmazione di NVIDIA registra 535,4 punti all’IOI 2026
La pagina di NVIDIA su Hugging Face descrive un modello di programmazione che ha ottenuto un punteggio superiore a quello del miglior concorrente umano nella prova dell’IOI 2026. Il risultato è stato raggiunto usando il modello insieme a una strategia separata che mette ripetutamente alla prova e corregge le risposte candidate.
Uno studio rileva scarso accordo con un giudice SQL in produzione
I ricercatori hanno testato un giudice IA usato in una pipeline text-to-SQL e hanno scoperto che spesso non concordava con i revisori umani. Secondo lo studio, un modello Qwen ospitato autonomamente ha ottenuto risultati molto migliori a una frazione del costo per chiamata.
Oossa · Newsletter
La settimana dell'IA, spiegata
Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.
Ieri
Un nuovo livello di mediazione permette agli agenti LLM di usare spazi dati regolamentati
I ricercatori hanno presentato un prototipo chiamato Eunomia Agent, che collega gli strumenti dei modelli linguistici di grandi dimensioni ai servizi degli spazi dati, mantenendo intatti i controlli sulle policy.
Un filtro basato su LLM riduce gli errori nelle trascrizioni automatiche di audio poliziesco rumoroso
I ricercatori hanno introdotto un filtro basato su un LLM per migliorare la pseudo-etichettatura nel riconoscimento vocale di comunicazioni radio della polizia disturbate dal rumore, riducendo gli errori di trascrizione.
Un utente di Reddit afferma che GPT-3 verrà dismesso
Un post su r/LocalLLaMA sostiene che GPT-3 verrà ritirato oggi e mette in dubbio la sostituzione suggerita. Il post non rimanda a un avviso ufficiale, quindi il cambiamento non è stato verificato in modo indipendente.
Qwen3-VL 8B alla prova su 137 documenti disordinati, usando un laptop
Un utente di Reddit ha confrontato un piccolo modello visivo eseguito in locale con tre modelli online, sottoponendogli ricevute, moduli, fatture e contratti. Nel test, Qwen ha ottenuto buoni risultati con i moduli fiscali, ma ha faticato a interpretare i formati di data indiani e i contratti lunghi.
Un utente di Reddit cerca un modello di coding a metà strada tra Qwen 3.8 27B e Flash Next
L’utente vuole un modello che bilanci le capacità di coding con una velocità di generazione di 75-100 token al secondo su un sistema con RTX 5090.
Qwen 3.8 27B funziona come sub-agente in llama.cpp su un Pi
Un post su Reddit mostra il modello Qwen 3.8 da 27 miliardi di parametri che lavora come sub-agente con DeepSeek v4.1 Flash su un Raspberry Pi.
Modulate raccoglie 25 milioni di dollari per i suoi strumenti di analisi vocale
La startup di Boston vende strumenti che analizzano le chiamate, rilevano audio sintetici e monitorano gli agenti vocali. Intende usare i nuovi fondi per ampliare i propri modelli e le opzioni di distribuzione orientate alla privacy.
Il bot Mica 4B raggiunge un piccone di diamante in Minecraft
Secondo uno sviluppatore, al suo primo tentativo il piccolo modello decisionale Mica ha guidato un bot di Minecraft dall’inventario vuoto fino a un piccone di diamante. Il test ha richiesto 26 decisioni: il bot si è occupato di muoversi e scavare, mentre il modello ha scelto i comandi.
DetectifAI vuole portare sui telefoni i controlli per individuare le voci deepfake
Dopo che una voce generata dall’IA ha ingannato suo nonno, spingendolo a pagare un riscatto, la fondatrice Tarini Padmanabhuni ha avviato DetectifAI. L’azienda afferma che i suoi modelli compatti possono individuare le voci false direttamente sul telefono, senza inviare l’audio al cloud.
La Florida chiede al tribunale di limitare il modo in cui ChatGPT si presenta
Il procuratore generale della Florida, James Uthmeier, vuole che un giudice impedisca a OpenAI di far apparire ChatGPT come un essere umano e imponga l’approvazione di soggetti esterni per le misure di sicurezza dei nuovi modelli. La richiesta rientra nella causa intentata dalla Florida contro OpenAI; nell’articolo non si riferisce di alcuna decisione del tribunale.
LlamAmpere v0.4 supera i 95 token al secondo su una RTX 3090
Uno sviluppatore afferma che l’ultima versione del fork di Llama.cpp può eseguire un modello Qwen da 27 miliardi di parametri con un contesto di 262K token su una sola RTX 3090. La velocità dichiarata si è mantenuta per tutti i 100.000 token generati.
Piccoli modelli open decidono rapidamente in un progetto di addestramento locale
Un utente di Reddit ha pubblicato piccoli modelli open-weight che scelgono tra diverse opzioni e restituiscono probabilità senza generare testo. L’utente riferisce un tempo di decisione di 28 millisecondi per il modello 0.8B e un punteggio dell’83,1% per il modello 2B in un test basato su cinque benchmark.
Qwen3.6-35B base supera la maggior parte delle versioni fine-tuned nel benchmark su Reddit
Un utente di Reddit ha confrontato il modello Qwen3.6-35B con cinque varianti fine-tuned in un benchmark di programmazione: il modello base si è rivelato generalmente superiore e solo Occamy-1.0 ha tenuto il passo.
Swift 1.5 riduce i tempi dei benchmark su una RTX 3090
Un utente di Reddit riferisce che una versione modificata di Swift 1.5 ha completato i benchmark circa il 37% più velocemente della configurazione base di HyperQwen su una singola RTX 3090. I risultati mostrano lievi differenze nei test di qualità.
Anthropic lancia Claude Sonnet 5.5 allo stesso prezzo per token
Anthropic afferma che il suo nuovo modello di fascia media è oltre il 30% più veloce e può costare fino al 30% in meno per attività rispetto a Sonnet 5. Nei test, si avvicina molto al più costoso Opus 5.5.
H Company lancia i modelli Holo4 per le attività software
Holo4 può operare su schermate, codice e strumenti software, senza dipendere da un solo modo di interagire con un computer. I due modelli sono disponibili tramite l’API di H Company, con pesi scaricabili.