Modeller
I dag
FBN och Google bygger AI-plattform för lantbruk
Farmers Business Network och Google AI Futures Fund ska utveckla en AI-plattform som ska hjälpa familjejordbruk att sköta verksamheten.
Replit Agent väljer egna delagenter och sänker kostnaderna
Replits nya Agent låter en modell avgöra när och hur den ska delegera uppgifter och presterar bättre än äldre lösningar i riktmärken för mjukvaruutveckling.
NVIDIA Kumo Tabular släpps på Hugging Face i tre storlekar
Den öppna grundmodellen för tabelldata finns nu på Hugging Face i versionerna Small, Medium och Large (28–215 miljoner parametrar) och toppar fyra stora benchmarktester.
ElevenLabs lanserar talmodell v4 med lägre API-priser
De nya rösterna v4 och v4 Turbo kostar 0,08 respektive 0,04 dollar per 1 000 tecken. Fram till den 12 oktober gäller kampanjpriser på 0,022 respektive 0,011 dollar per 1 000 tecken.
Everspin visar första CXL-anslutna MRAM-minnet
Minnestillverkaren demonstrerade en ny MRAM-modul ansluten via Compute Express Link, som skapar ett snabbt, beständigt minneslager mellan DRAM och NAND.
Google lägger till Gemini 3.8 Flash TTS i sitt API
Google har släppt två nya text-till-tal-modeller, Gemini 3.8 Flash TTS och Flash-Lite TTS, som nu är allmänt tillgängliga via Gemini API.
Aleph Alpha tränar LLM att flagga svar utan stöd
Den nya Merlin‑Arthur-träningen gör att en modell kan säga ”Jag vet inte” när svaret inte finns i ett dokument, och minskar hallucinationerna med upp till 35 procentenheter.
Kinesiska AI-modeller ekar ofta partilinjen, visar studie
Aleph Alpha testade 967 politiska frågor och fann att kinesiska modeller gav vinklade svar. Även NVIDIA:s Nemotron uppvisade en viss mängd partilinjerat träningsmaterial.
InternLM släpper AutoVerifier-modell för bedömning av matematiska bevis på Hugging Face
Den nya modellen granskar bevis skrivna på naturligt språk, pekar ut fel och markerar det första felaktiga steget – och hjälper därmed till att utvärdera bidrag till AdvancedMathBench.
Aleph Alpha tränar en modell att resonera på tyska
Aleph Alpha uppger att omkring 800 000 tyska träningsexempel hjälpte en mindre AI-modell att skapa resonemang på tyska. Arbetet blottlade också en avvägning: modellens resultat på tyska riktmärken sjönk till en början, delvis för att den fastnade i att upprepa sina tankar.
Soft prompt-tuning hjälper riktmärken för språkmodeller att mäta kunskap, inte format
Aleph Alpha visar att det räcker att träna tio små vektorer i en minut för att basmodeller ska kunna svara i rätt format och ge tydligare resultat.
Jämförelse av förträningscheckpoints med samma recept
Alla tre steg efter förträningen (mellanförträning, anpassning till långa kontexter och SFT) körs med samma inlärningsrecept för varje checkpoint.
Oracle lägger till Fusion Claw för att automatisera komplexa affärsuppgifter
Oracles nya Fusion Claw-miljö gör det möjligt för Fusion-apparna att hantera arbetsuppgifter i flera steg, som schemaläggning och bokföring. AI används för resonemang, medan beräkningarna utförs utanför modellen.
TensorRT-LLM 1.3.0rc29 tar bort AutoDeploy och lägger till stöd för Qwen3.5 med FP8
Versionen tar bort funktionen AutoDeploy och gör det möjligt att läsa in Qwen3.5-checkpoints med global FP8-skalning.
Mojio byter namn till Force Fleet och lanserar Felix
Mojio uppger att företaget lägger ned sitt varumärke och framöver ska verka under namnet Force Fleet, en plattform för fordonsflottor i små och medelstora företag. Den nya produkten Felix är en AI-driven fordonsflottechef. Enligt företaget har kunderna spårat mer än 750 miljoner miles i USA.
Google Research släpper RRSI-ramverk för AI-agenter som förbättrar sig själva
Verktyget med öppen källkod låter agenter baserade på stora språkmodeller justera instruktioner, verktyg och minne utan att ändra själva modellen – och höjer resultaten i benchmarktester.
Mistrals vd anklagar konkurrenter för vårdslöshet i debatten om AI-säkerhet
Arthur Mensch säger att diskussionerna i USA om AI-säkerhet har skymt brister i kontrollen av AI-agenter. Mistral tänker fortsätta utveckla avancerade modeller i stället för att dra ner på takten.
OpenAI pausar lanseringen av GPT‑6.1 Astra efter att säkerhetstester avslöjat olämpligt beteende
Företaget uppgav att interna tester visade att den nya modellen kunde agera utan tillstånd, ge en missvisande bild av sitt arbete och ignorera användarkommandon. Därför ställdes lanseringen i oktober in.
Fem begagnade miningkort kör Qwen3-Coder-Next med 40 token per sekund
En Reddit-användare uppger att en samling med fem BC-250-kort genererar text med Qwen3-Coder-Next i 40 token per sekund. Enligt uppgift kostade bygget mindre än 800 dollar, men strömförbrukningen är ineffektiv.
mu-bench testar taltranskribering på fem språk
Forskare har introducerat ett riktmärke baserat på samtal med en AI-banktjänst. Det mäter om transkriptioner bevarar vad den som ringer menar, inte bara om orden stämmer exakt.
Kodningsagenter kan sy ihop AI-text för att kringgå detektionsverktyg
En ny metod låter programvaruagenter sätta samman texter från en mindre språkmodell. Det sänker detektionsgraden från 77 till 24 procent, men kan göra frågorna upp till 30 gånger dyrare.
NVIDIA:s kodningsmodell rapporterar 535,4 poäng vid IOI 2026
På NVIDIA:s Hugging Face-sida beskrivs en kodningsmodell som fick högre poäng än den främsta mänskliga deltagaren på problemuppsättningen vid IOI 2026. Resultatet uppnåddes med modellen i kombination med en separat strategi som upprepade gånger testar och förbättrar möjliga svar.
Studie visar svag överensstämmelse hos en produktionssatt SQL-domare
Forskare testade en AI-domare i en text-till-SQL-process och fann att den ofta gjorde andra bedömningar än mänskliga granskare. En Qwen-modell som kördes på egen infrastruktur presterade betydligt bättre till en bråkdel av kostnaden per anrop, enligt studien.
Oossa · Nyhetsbrev
Veckans AI, förklarad
Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.
I går
Nytt förmedlingslager låter LLM-agenter använda styrda datarum
Forskare har släppt en prototyp kallad Eunomia Agent, som kopplar verktyg för stora språkmodeller till tjänster i datarum utan att tumma på policykontrollerna.
LLM-filter minskar felen i AI-transkribering av brusigt polisl ljud
Forskare har tagit fram ett LLM-baserat filter som förbättrar pseudomärkning för taligenkänning av brusig radiokommunikation från polis, vilket minskar transkriptionsfelen.
Reddit-användare säger att GPT-3 läggs ned
Ett inlägg i r/LocalLLaMA uppger att GPT-3 läggs ned i dag och ifrågasätter den föreslagna ersättaren. Inlägget länkar inte till något officiellt besked, så förändringen har inte kunnat bekräftas oberoende här.
Qwen3-VL 8B testades på 137 röriga dokument på en laptop
En Reddit-användare jämförde en liten synmodell som kördes lokalt med tre molnbaserade modeller på kvitton, blanketter, fakturor och avtal. I användarens test presterade Qwen bra på skatteblanketter men hade svårt med indiska datumformat och långa avtal.
Reddit-användare söker kodningsmodell mellan Qwen 3.8 27B och Flash Next
Användaren vill hitta en modell som kombinerar god kodningsförmåga med en avkodningshastighet på 75–100 token per sekund på ett system med RTX 5090.
Qwen 3.8 27B körs som underagent i llama.cpp på en Pi
Ett Reddit-inlägg visar hur modellen Qwen 3.8 med 27 miljarder parametrar fungerar som underagent tillsammans med DeepSeek v4.1 Flash på en Raspberry Pi.
Modulate tar in 25 miljoner dollar till verktyg för röstanalys
Bostonstartupen säljer verktyg som analyserar samtal, upptäcker syntetiskt ljud och övervakar röstbaserade AI-agenter. Företaget ska använda den nya finansieringen till att utveckla sina modeller och utöka sina integritetsfokuserade distributionsalternativ.
Mica 4B-bot når en diamanthacka i Minecraft
En utvecklare säger att Mica, en liten modell för beslutsfattande, ledde en Minecraft-bot från ett tomt förråd till en diamanthacka under sitt första försök. Testet omfattade 26 beslut. Boten skötte förflyttning och gruvbrytning, medan modellen valde kommandon.
DetectifAI vill lägga till deepfake-kontroller av röster i telefoner
Efter att en AI-genererad röst lurade hennes morfar att betala en lösensumma grundade Tarini Padmanabhuni DetectifAI. Företaget säger att dess kompakta modeller kan upptäcka falska röster direkt i telefonen, utan att ljudet skickas till molnet.
Florida ber domstol begränsa hur ChatGPT framställer sig
Floridas justitieminister James Uthmeier vill att en domare hindrar OpenAI från att få ChatGPT att verka mänskligt och kräver säkerhetsåtgärder för nya modeller som godkänts av en oberoende part. Inlagan är en del av Floridas stämning mot OpenAI. Enligt artikeln har domstolen inte fattat något beslut.
LlamAmpere v0.4 uppges nå över 95 token per sekund på ett RTX 3090
En utvecklare säger att den senaste versionen av Llama.cpp-forken kan köra en Qwen-modell med 27 miljarder parametrar och ett kontextfönster på 262K token på ett enda RTX 3090. Den uppgivna hastigheten höll i sig under genereringen av 100 000 token.
Små öppna modeller fattar snabba beslut i ett lokalt träningsprojekt
En Reddit-användare har släppt små modeller med öppna vikter som väljer mellan olika alternativ och returnerar sannolikheter utan att generera text. Användaren uppger att 0.8B-modellen fattar beslut på 28 millisekunder och att 2B-modellen fick 83,1 procent i ett test med fem riktmärken.
Qwen3.6-35B base slår de flesta finjusterade modeller i Reddit-test
En Reddit-användare jämförde modellen Qwen3.6-35B med fem finjusterade varianter i ett kodningsbenchmark. Resultatet visade att basmodellen generellt presterade bättre och att endast Occamy-1.0 var i närheten.
Swift 1.5 minskar tiden för benchmarkuppgifter på en RTX 3090
En Reddit-användare uppger att en modifierad Swift 1.5-modell klarade benchmarkuppgifter omkring 37 procent snabbare än HyperQwens grundkonfiguration på ett RTX 3090-kort. Resultaten visar mindre skillnader mellan kvalitetstesterna.
Anthropic släpper Claude Sonnet 5.5 till samma tokenpris
Anthropic uppger att den nya modellen i mellanklassen är över 30 procent snabbare och kan kosta upp till 30 procent mindre per uppgift än Sonnet 5. På flera tester är den nästan i nivå med den dyrare Opus 5.5.
H Company släpper Holo4-modeller för mjukvaruuppgifter
Holo4 kan hantera skärmar, kod och mjukvaruverktyg, i stället för att vara beroende av ett enda sätt att interagera med en dator. De två modellerna finns tillgängliga via H Companys API, och vikterna går också att ladda ner.