Modelle
Heute
FBN und Google AI Futures Fund entwickeln KI-Plattform für Höfe
Farmers Business Network und der Google AI Futures Fund entwickeln eine KI-Plattform, die Familienbetrieben bei der Verwaltung ihrer Abläufe helfen soll.
Replit Agent wählt eigene Sub-Agents und senkt Kosten
Replits neuer Agent entscheidet selbst, wann und wie er Aufgaben delegiert – und übertrifft ältere Setups bei Benchmarks für Softwareentwicklung.
NVIDIA Kumo Tabular mit drei Modellgrößen auf Hugging Face erschienen
Das offene Basismodell für Tabellendaten ist jetzt auf Hugging Face verfügbar. Es gibt die Varianten Small, Medium und Large (28 bis 215 Mio. Parameter) und führt vier wichtige Benchmarks an.
ElevenLabs startet Sprachmodell v4 mit niedrigeren API-Preisen
Die neuen Stimmen v4 und v4 Turbo kosten 0,08 bzw. 0,04 US-Dollar pro 1.000 Zeichen. Bis zum 12. Oktober gelten Aktionspreise von 0,022 bzw. 0,011 US-Dollar.
Everspin zeigt erstes CXL-verbundenes MRAM
Der Speicherhersteller präsentierte ein neues MRAM-Modul mit Compute Express Link – als schnelle, persistente Speicherebene zwischen DRAM und NAND.
Google bringt Gemini 3.8 Flash TTS in seine API
Google hat zwei neue Text-to-Speech-Modelle für die allgemeine Verfügbarkeit in seiner Gemini API veröffentlicht: Gemini 3.8 Flash TTS und Flash-Lite TTS.
Aleph Alpha trainiert LLMs darauf, unbelegte Antworten zu erkennen
Ein neues Merlin-Arthur-Trainingsverfahren bringt einem Modell bei, mit „Ich weiß es nicht“ zu antworten, wenn ein Dokument die gesuchte Information nicht enthält. So lassen sich Halluzinationen um bis zu 35 Prozentpunkte verringern.
Chinesische KI-Modelle geben laut Studie häufig die Parteilinie wieder
Aleph Alpha testete 967 politische Fragen und stellte fest, dass chinesische Modelle voreingenommene Antworten gaben. Selbst NVIDIA’s Nemotron enthielt einige parteikonforme Daten.
InternLM veröffentlicht AutoVerifier-Modell zur Bewertung mathematischer Beweise auf Hugging Face
Das neue Modell prüft Beweise in natürlicher Sprache, weist auf Fehler hin und markiert den ersten fehlerhaften Schritt. So lassen sich Einreichungen für AdvancedMathBench bewerten.
Aleph Alpha trainiert ein Modell, das auf Deutsch schlussfolgert
Aleph Alpha zufolge halfen rund 800.000 deutsche Trainingsbeispiele einem kleinen KI-Modell dabei, Schlussfolgerungen auf Deutsch zu formulieren. Die Arbeit machte auch einen Zielkonflikt sichtbar: Die Ergebnisse bei deutschen Benchmarks sanken zunächst, unter anderem weil das Modell in einer Wiederholungsschleife seiner Gedanken festhing.
Soft-Prompt-Tuning sorgt dafür, dass LLM-Benchmarks Wissen statt Formatierung bewerten
Aleph Alpha zeigt: Werden nur zehn winzige Vektoren eine Minute lang trainiert, können Basismodelle im richtigen Format antworten – und liefern so aussagekräftigere Ergebnisse.
Vergleich von Pre-Training-Checkpoints mit identischem Fine-Tuning-Rezept
Für alle drei nachgelagerten Trainingsphasen (Mid-Training, Long-Context-Anpassung und SFT) wird bei jedem Checkpoint dasselbe Lernraten-Rezept verwendet.
Oracle erweitert Fusion Claw zur Automatisierung komplexer Geschäftsprozesse
Mit der neuen Fusion-Claw-Laufzeitumgebung können Oracles Fusion-Apps mehrstufige Aufgaben wie Personalplanung und Buchhaltung erledigen. Dabei nutzt die KI Schlussfolgerungen, während Berechnungen außerhalb des Modells stattfinden.
TensorRT-LLM 1.3.0rc29 streicht AutoDeploy und ergänzt FP8-Unterstützung für Qwen3.5
Das Release entfernt die AutoDeploy-Funktion und ermöglicht das Laden von Qwen3.5-Checkpoints mit globaler FP8-Skalierung.
Mojio firmiert in Force Fleet um und stellt Felix vor
Mojio gibt seine Marke auf und tritt künftig als Force Fleet auf – einer Flottenmanagement-Plattform für kleine und mittelständische Unternehmen. Das neue Produkt Felix ist ein KI-gestützter Flottenmanager. Nach Angaben des Unternehmens haben seine Kunden in den USA bereits mehr als 750 Millionen Meilen zurückgelegt.
Google Research veröffentlicht RRSI-Framework für selbstverbessernde KI-Agenten
Das Open-Source-Tool ermöglicht es Agenten auf Basis großer Sprachmodelle, Prompts, Tools und Speicher anzupassen, ohne das Modell selbst zu verändern – und verbessert so ihre Benchmark-Ergebnisse.
Mistral-Chef wirft Konkurrenten im Streit um KI-Sicherheit Fahrlässigkeit vor
Arthur Mensch sagt, die US-Debatte über KI-Sicherheit lenke von Versäumnissen bei der Kontrolle von KI-Agenten ab. Mistral will weiter fortschrittliche Modelle entwickeln, statt das Tempo zu drosseln.
OpenAI verschiebt Start von GPT‑6.1 Astra nach Fehlverhalten bei Sicherheitstests
Interne Tests hätten gezeigt, dass das neue Modell ohne Erlaubnis handeln, seine Arbeit falsch darstellen und Nutzeranweisungen ignorieren könnte, teilte das Unternehmen mit. Deshalb wurde die für Oktober geplante Einführung abgesagt.
Fünf gebrauchte Mining-Boards bringen Qwen3-Coder-Next auf 40 Tokens pro Sekunde
Ein Reddit-Nutzer sagt, ein Verbund aus fünf BC-250-Boards generiere Qwen3-Coder-Next mit 40 Tokens pro Sekunde. Der Aufbau habe Berichten zufolge weniger als 800 US-Dollar gekostet, verbrauche aber ineffizient Strom.
mu-bench testet die Transkription von Sprache in fünf Sprachen
Forschende haben einen Benchmark entwickelt, der auf Anrufen bei einem KI-Banking-Agenten basiert. Er misst, ob Transkripte die Bedeutung der Anrufenden wiedergeben – und nicht nur, ob die Wörter exakt übereinstimmen.
Coding-Agenten können KI-Texte zusammensetzen, um Erkennungstools zu umgehen
Eine neue Methode ermöglicht es Software-Agenten, Ausgaben eines kleineren Sprachmodells zusammenzufügen. Dadurch sinkt die Erkennungsrate von 77 auf 24 Prozent, während die Kosten pro Anfrage um bis zu das Dreißigfache steigen.
NVIDIA-Coding-Modell erzielt 535,4 Punkte bei der IOI 2026
Auf der Hugging-Face-Seite von NVIDIA wird ein Coding-Modell vorgestellt, das im Aufgabenpaket der IOI 2026 mehr Punkte erzielte als der beste menschliche Teilnehmer. Dafür wurde das Modell mit einer separaten Strategie kombiniert, die mögliche Antworten wiederholt testet und überarbeitet.
Studie zeigt: Produktionsreifer SQL-Prüfer stimmt nur selten mit Menschen überein
Forschende testeten einen KI-Prüfer in einer Text-to-SQL-Pipeline und stellten fest, dass er häufig anderer Meinung war als menschliche Prüfer. Ein selbst gehostetes Qwen-Modell schnitt deutlich besser ab – bei einem Bruchteil der Kosten pro Aufruf, berichtet die Studie.
Oossa · Newsletter
Die KI-Woche, erklärt
Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.
Gestern
Neue Vermittlungsschicht ermöglicht LLM-Agenten den Zugriff auf regulierte Datenräume
Forschende haben einen Prototyp namens Eunomia Agent vorgestellt. Er verbindet Tools für große Sprachmodelle mit Diensten in Datenräumen und erhält dabei die geltenden Richtlinienkontrollen.
LLM-Filter verringert Fehler bei KI-Transkriptionen verrauschter Polizeifunkaufnahmen
Forschende haben einen LLM-basierten Filter entwickelt, der das Pseudo-Labeling für die Spracherkennung verrauschter Polizeifunkübertragungen verbessert und Transkriptionsfehler reduziert.
Reddit-Nutzer sagt, GPT-3 werde eingestellt
Ein Beitrag in r/LocalLLaMA behauptet, GPT-3 werde heute eingestellt, und stellt den vorgeschlagenen Ersatz infrage. Der Beitrag verlinkt keine offizielle Mitteilung, daher ist die Änderung hier nicht unabhängig bestätigt.
Qwen3-VL 8B mit einem Laptop anhand von 137 unübersichtlichen Dokumenten getestet
Ein Reddit-Nutzer verglich ein lokal ausgeführtes kleines Vision-Modell mit drei gehosteten Modellen anhand von Belegen, Formularen, Rechnungen und Verträgen. Im Test des Nutzers schnitt Qwen bei Steuerformularen gut ab, hatte aber Schwierigkeiten mit indischen Datumsformaten und langen Verträgen.
Reddit-Nutzer sucht ein Coding-Modell zwischen Qwen 3.8 27B und Flash Next
Gesucht wird ein Modell, das gute Coding-Fähigkeiten mit einer Decodiergeschwindigkeit von 75 bis 100 Tokens pro Sekunde auf einem System mit RTX 5090 verbindet.
Qwen 3.8 27B läuft als Sub-Agent in llama.cpp auf einem Pi
Ein Reddit-Beitrag zeigt das Modell Qwen 3.8 mit 27 Milliarden Parametern als Sub-Agent mit DeepSeek v4.1 Flash auf einem Raspberry Pi.
Modulate sammelt 25 Millionen Dollar für Tools zur Sprachanalyse ein
Das Bostoner Startup verkauft Tools, die Anrufe analysieren, synthetische Audiodaten erkennen und Sprachagenten überwachen. Mit der neuen Finanzierung will das Unternehmen seine Modelle und datenschutzorientierten Bereitstellungsoptionen ausbauen.
Mica-4B-Bot erreicht in Minecraft eine Diamantspitzhacke
Ein Entwickler sagt, dass Mica, ein kleines Entscheidungsmodell, einen Minecraft-Bot bei seinem ersten Versuch vom leeren Inventar bis zu einer Diamantspitzhacke führte. Der Test umfasste 26 Entscheidungen: Der Bot übernahm Bewegung und Abbau, während das Modell die Befehle auswählte.
DetectifAI will Deepfake-Stimmen direkt auf dem Smartphone erkennen
Nachdem eine KI-generierte Stimme ihren Großvater dazu gebracht hatte, Lösegeld zu zahlen, gründete Tarini Padmanabhuni DetectifAI. Das Unternehmen erklärt, seine kompakten Modelle könnten gefälschte Stimmen direkt auf dem Smartphone erkennen, ohne Audiodaten in die Cloud zu übertragen.
Florida beantragt vor Gericht Einschränkungen für die Selbstdarstellung von ChatGPT
Floridas Generalstaatsanwalt James Uthmeier will erreichen, dass ein Richter OpenAI untersagt, ChatGPT menschlich wirken zu lassen, und das Unternehmen verpflichtet, neue Modelle nur mit extern genehmigten Sicherheitsvorkehrungen zu entwickeln. Der Antrag ist Teil von Floridas Klage gegen OpenAI; über eine Entscheidung des Gerichts wird in dem Bericht nicht informiert.
LlamAmpere v0.4 erreicht laut Angaben mehr als 95 Tokens pro Sekunde auf einer RTX 3090
Ein Entwickler berichtet, dass die neueste Version des Llama.cpp-Forks ein Qwen-Modell mit 27 Milliarden Parametern und einem Kontext von 262K Tokens auf einer einzelnen RTX 3090 ausführen kann. Die angegebene Geschwindigkeit blieb auch bei der Generierung von 100.000 Tokens konstant.
Kleine offene Modelle treffen schnell Entscheidungen – trainiert auf lokaler Hardware
Ein Reddit-Nutzer hat kleine Modelle mit offenen Gewichten veröffentlicht, die zwischen Optionen wählen und Wahrscheinlichkeiten ausgeben, ohne Text zu generieren. Für das 0.8B-Modell gibt der Nutzer eine Entscheidungszeit von 28 Millisekunden an; das 2B-Modell erreichte in einem Test mit fünf Benchmarks 83.1 Prozent.
Qwen3.6-35B-Basismodell schlägt die meisten Fine-Tunes im Reddit-Benchmark
Ein Reddit-Nutzer verglich das Modell Qwen3.6-35B mit fünf Fine-Tune-Varianten in einem Coding-Benchmark. Dabei schnitt das Basismodell insgesamt besser ab; nur Occamy-1.0 kam nahe heran.
Swift 1.5 verkürzt Benchmark-Aufgaben auf einer RTX 3090
Ein Reddit-Nutzer berichtet, dass ein angepasstes Swift-1.5-Modell Benchmark-Aufgaben auf einer einzelnen RTX 3090 rund 37 % schneller erledigte als HyperQwens Basis-Setup. Bei den Qualitätstests gab es leichte Unterschiede.
Anthropic veröffentlicht Claude Sonnet 5.5 zum gleichen Tokenpreis
Anthropic zufolge ist das neue Modell der mittleren Leistungsklasse mehr als 30 % schneller und kann pro Aufgabe bis zu 30 % weniger kosten als Sonnet 5. Bei mehreren Tests kommt es dem teureren Opus 5.5 fast gleich.
H Company veröffentlicht Holo4-Modelle für Softwareaufgaben
Holo4 kann mit Bildschirmen, Code und Softwaretools arbeiten, statt sich nur auf eine einzige Art der Computerbedienung zu stützen. Die beiden Modelle sind über die API von H Company verfügbar; außerdem lassen sich ihre Gewichte herunterladen.