Modellen
Vandaag
FBN en Google AI Futures Fund bouwen AI-platform voor boerderijen
Farmers Business Network en Google AI Futures Fund ontwikkelen een AI-platform dat familiebedrijven moet helpen hun bedrijfsvoering te beheren.
Replit Agent kiest zelf subagents en verlaagt kosten
Met de nieuwe Agent van Replit bepaalt een model zelf wanneer en hoe het taken uitbesteedt. Op benchmarks voor softwareontwikkeling presteert het beter dan eerdere systemen.
NVIDIA Kumo Tabular verschijnt op Hugging Face in drie formaten
Het open basismodel voor tabelgegevens is nu beschikbaar op Hugging Face in de formaten Small, Medium en Large (28–215 miljoen parameters) en voert vier belangrijke benchmarks aan.
ElevenLabs lanceert spraakmodel v4 met lagere tarieven en snellere Turbo
De nieuwe stemmen van v4 en v4 Turbo kosten $0,08 en $0,04 per 1.000 tekens. Tot 12 oktober geldt een actieprijs van respectievelijk $0,022 en $0,011 per 1.000 tekens.
Everspin toont eerste via CXL gekoppelde MRAM
De geheugenfabrikant demonstreerde een nieuwe MRAM-module via Compute Express Link, als snelle persistente laag tussen DRAM en NAND.
Google voegt Gemini 3.8 Flash TTS-modellen toe aan API
Google heeft twee nieuwe tekst-naar-spraakmodellen algemeen beschikbaar gemaakt via de Gemini API: Gemini 3.8 Flash TTS en Flash-Lite TTS.
Aleph Alpha traint LLM om ongefundeerde antwoorden te signaleren
Met de nieuwe Merlin-Arthur-training leert een model ‘Ik weet het niet’ te zeggen als het antwoord niet in een document staat. Zo daalt het aantal hallucinaties met maximaal 35 procentpunt.
Chinese AI-modellen echoën vaak de partijlijn, blijkt uit onderzoek
Aleph Alpha testte 967 politieke prompts en zag dat Chinese modellen bevooroordeelde antwoorden gaven. Zelfs NVIDIA’s Nemotron bleek deels trainingsdata te bevatten die de partijlijn volgt.
InternLM brengt AutoVerifier-model uit voor het beoordelen van wiskundige bewijzen op Hugging Face
Het nieuwe model controleert bewijzen in natuurlijke taal, wijst fouten aan en markeert de eerste onjuiste stap. Zo kunnen inzendingen voor AdvancedMathBench worden beoordeeld.
Aleph Alpha traint een model om in het Duits te redeneren
Aleph Alpha zegt dat zo’n 800.000 Duitse trainingsvoorbeelden een klein AI-model hielpen om redeneerstappen in het Duits te produceren. Het onderzoek bracht ook een afruil aan het licht: de scores op Duitse benchmarks daalden aanvankelijk, deels doordat het model bleef hangen in het herhalen van zijn gedachten.
Soft-prompt-tuning laat benchmarks kennis meten, niet de opmaak
Aleph Alpha laat zien dat je basismodellen met slechts tien kleine vectoren in één minuut het juiste antwoordformaat kunt aanleren, voor duidelijkere scores.
Vergelijking van pre-trainingscheckpoints met een identiek trainingsrecept
Voor elk checkpoint worden dezelfde leerpercentages gebruikt in alle drie de vervolgfasen (mid-training, aanpassing aan lange contexten en SFT).
Oracle voegt Fusion Claw toe om complexe bedrijfstaken te automatiseren
Met Oracle’s nieuwe Fusion Claw-runtime kunnen Fusion-apps meerstapstaken uitvoeren, zoals personeelsplanning en boekhouding. AI wordt ingezet voor het redeneren, terwijl berekeningen buiten het model blijven.
TensorRT-LLM 1.3.0rc29 schrapt AutoDeploy en voegt ondersteuning voor Qwen3.5 FP8 toe
De release verwijdert de functie AutoDeploy en maakt het mogelijk Qwen3.5-checkpoints met globale FP8-schaling te laden.
Mojio gaat verder als Force Fleet en lanceert Felix
Mojio zegt zijn merknaam vaarwel en gaat verder als Force Fleet, een platform voor wagenparkbeheer voor kleine en middelgrote bedrijven. Het nieuwe product, Felix, is een AI-gestuurde wagenparkbeheerder. Volgens het bedrijf hebben klanten in de Verenigde Staten meer dan 750 miljoen mijl geregistreerd.
Google Research brengt RRSI-framework uit voor zelfverbeterende AI-agenten
Met deze open-sourcetool kunnen agenten op basis van grote taalmodellen hun prompts, tools en geheugen aanpassen zonder het model zelf te wijzigen, waardoor hun benchmarkscores stijgen.
Mistral-topman beschuldigt rivalen van nalatigheid in debat over AI-veiligheid
Arthur Mensch zegt dat de Amerikaanse discussie over AI-veiligheid de aandacht heeft afgeleid van het gebrek aan controle over AI-agenten. Mistral blijft geavanceerde modellen ontwikkelen en is niet van plan de ontwikkeling te vertragen.
OpenAI stelt lancering GPT‑6.1 Astra uit na veiligheidstests die wangedrag aan het licht brachten
Het bedrijf zei dat interne tests uitwezen dat het nieuwe model zonder toestemming kon handelen, onjuist kon weergeven wat het had gedaan en opdrachten van gebruikers kon negeren. Daarom is de uitrol in oktober afgeblazen.
Vijf gebruikte miningborden draaien Qwen3-Coder-Next met 40 tokens per seconde
Een Reddit-gebruiker zegt dat een cluster van vijf BC-250-borden Qwen3-Coder-Next genereert met 40 tokens per seconde. De opstelling kostte naar verluidt minder dan $800, maar verbruikt stroom inefficiënt.
mu-bench test spraakherkenning in vijf talen
Onderzoekers hebben een benchmark ontwikkeld op basis van gesprekken met een AI-bankier. Die meet of transcripties de betekenis van bellers behouden, niet alleen of hun woorden exact overeenkomen.
Codeeragenten kunnen AI-tekst aan elkaar plakken om detectietools te omzeilen
Met een nieuwe methode kunnen softwareagenten teksten samenstellen uit de output van een kleiner taalmodel. Daardoor daalt het detectiepercentage van 77% naar 24%, maar kunnen de kosten per query tot dertig keer hoger uitvallen.
NVIDIA-codingmodel haalt 535,4 punten op IOI 2026
Op de Hugging Face-pagina van NVIDIA staat dat een codingmodel hoger scoorde dan de beste menselijke deelnemer op de opgaven van IOI 2026. Het resultaat werd behaald met het model in combinatie met een aparte strategie die mogelijke antwoorden herhaaldelijk test en bijstelt.
Onderzoek vindt weinig overeenstemming met een SQL-beoordelaar in productie
Onderzoekers testten een AI-beoordelaar in een text-to-SQL-pijplijn en ontdekten dat die het vaak oneens was met menselijke beoordelaars. Volgens het onderzoek presteerde een zelf gehost Qwen-model veel beter, tegen een fractie van de kosten per aanroep.
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.
Gisteren
Nieuwe bemiddelingslaag laat LLM-agenten gebruikmaken van gereguleerde dataruimten
Onderzoekers hebben een prototype uitgebracht, de Eunomia Agent, dat tools voor grote taalmodellen koppelt aan diensten voor dataruimten, met behoud van de beleidscontroles.
LLM-filter vermindert fouten in AI-transcripties van rumoerige politiecommunicatie
Onderzoekers introduceerden een filter op basis van een LLM om de pseudolabeling voor spraakherkenning op rumoerige politie-uitzendingen te verbeteren en het aantal transcriptiefouten te verlagen.
Reddit-gebruiker zegt dat GPT-3 wordt uitgefaseerd
In een bericht op r/LocalLLaMA staat dat GPT-3 vandaag wordt uitgefaseerd. De gebruiker zet vraagtekens bij de voorgestelde vervanger. Het bericht bevat geen link naar een officiële aankondiging, dus de wijziging is hier niet onafhankelijk bevestigd.
Qwen3-VL 8B getest op 137 rommelige documenten met een laptop
Een Reddit-gebruiker vergeleek een klein lokaal draaiend visionmodel met drie modellen in de cloud aan de hand van bonnetjes, formulieren, facturen en contracten. In de test deed Qwen het goed op belastingformulieren, maar had het moeite met Indiase datumnotaties en lange contracten.
Reddit-gebruiker zoekt een codeermodel tussen Qwen 3.8 27B en Flash Next
De gebruiker zoekt een model dat goede codeercapaciteiten combineert met een decodeersnelheid van 75–100 tokens per seconde op een systeem met een RTX 5090.
Qwen 3.8 27B draait als subagent in llama.cpp op een Pi
Een Reddit-post laat zien hoe het model Qwen 3.8 met 27 miljard parameters als subagent samenwerkt met DeepSeek v4.1 Flash op een Raspberry Pi.
Modulate haalt 25 miljoen dollar op voor tools voor stemanalyse
De startup uit Boston verkoopt tools die gesprekken analyseren, synthetische audio opsporen en stemassistenten monitoren. Het bedrijf wil de nieuwe financiering gebruiken om zijn modellen en privacygerichte implementatiemogelijkheden uit te breiden.
Mica 4B-bot komt in Minecraft aan een diamanten houweel
Een ontwikkelaar zegt dat Mica, een klein model voor besluitvorming, een Minecraft-bot tijdens zijn eerste run van een lege inventaris naar een diamanten houweel leidde. De test bestond uit 26 beslissingen: de bot verzorgde het bewegen en delven, terwijl het model de opdrachten koos.
DetectifAI wil deepfake-stemcontroles naar telefoons brengen
Nadat een AI-gegenereerde stem haar grootvader ertoe had gebracht losgeld te betalen, richtte oprichter Tarini Padmanabhuni DetectifAI op. Het bedrijf zegt dat zijn compacte modellen nepstemmen op een telefoon kunnen herkennen zonder audio naar de cloud te sturen.
Florida vraagt rechter om te beperken hoe ChatGPT zich presenteert
De procureur-generaal van Florida, James Uthmeier, wil dat een rechter OpenAI verbiedt ChatGPT menselijk te laten lijken en het bedrijf verplicht om voor nieuwe modellen veiligheidsmaatregelen te laten goedkeuren door een externe partij. Het verzoek maakt deel uit van de rechtszaak die Florida tegen OpenAI heeft aangespannen; het artikel vermeldt geen uitspraak van de rechter.
LlamAmpere v0.4 haalt volgens melding meer dan 95 tokens per seconde op een RTX 3090
Een ontwikkelaar zegt dat de nieuwste versie van de Llama.cpp-fork een Qwen-model met 27 miljard parameters en een context van 262K tokens op één RTX 3090 kan draaien. De gemelde snelheid bleef behouden tijdens het genereren van 100.000 tokens.
Kleine open modellen nemen snel beslissingen in lokaal trainingsproject
Een Reddit-gebruiker heeft kleine modellen met open gewichten uitgebracht die een keuze maken uit verschillende opties en kansen teruggeven zonder tekst te genereren. De gebruiker meldt een beslistijd van 28 milliseconden voor het 0.8B-model en een score van 83.1% voor het 2B-model op een test met vijf benchmarks.
Qwen3.6-35B-basismodel presteert beter dan de meeste finetunes in Reddit-benchmark
Een Reddit-gebruiker vergeleek het Qwen3.6-35B-model met vijf gefinetunede varianten in een programmeerbenchmark. Het basismodel bleek over het algemeen beter te presteren; alleen Occamy-1.0 kwam in de buurt.
Swift 1.5 voert benchmarktaken sneller uit op een RTX 3090
Een Reddit-gebruiker meldt dat een aangepast Swift 1.5-model benchmarktaken op één RTX 3090 ongeveer 37% sneller uitvoerde dan de basisconfiguratie van HyperQwen. De resultaten laten kleine verschillen zien in de kwaliteitstests.
Anthropic brengt Claude Sonnet 5.5 uit voor dezelfde tokenprijs
Volgens Anthropic is het nieuwe middenklassemodel ruim 30% sneller en kan het per taak tot 30% goedkoper zijn dan Sonnet 5. Bij verschillende tests benadert het de duurdere Opus 5.5.
H Company brengt Holo4-modellen uit voor softwaretaken
Holo4 kan overweg met schermen, code en softwaretools, in plaats van op slechts één manier met een computer te werken. De twee modellen zijn beschikbaar via de API van H Company, en ook de modelgewichten zijn te downloaden.