Modèles
Aujourd’hui
FBN et Google créent un moteur IA pour les fermes
Farmers Business Network et Google AI Futures Fund vont développer une plateforme d’IA pour aider les exploitations familiales à gérer leurs activités.
Replit Agent choisit ses sous-agents et réduit les coûts
Le nouvel Agent de Replit laisse le modèle décider quand et comment déléguer les tâches, avec de meilleurs résultats que les anciennes configurations sur des benchmarks de génie logiciel.
NVIDIA Kumo Tabular lancé sur Hugging Face en trois tailles
Ce modèle de fondation ouvert pour les données tabulaires, désormais disponible sur Hugging Face, existe en versions Small, Medium et Large (de 28 à 215 M de paramètres) et arrive en tête de quatre grands benchmarks.
ElevenLabs lance v4 : tarifs API réduits et Turbo plus rapide
Les nouvelles voix v4 et v4 Turbo coûtent 0,08 $ et 0,04 $ pour 1 000 caractères. Jusqu’au 12 octobre, les tarifs promotionnels passent respectivement à 0,022 $ et 0,011 $.
Everspin présente la première MRAM connectée en CXL
Le fabricant de mémoire a présenté un nouveau module MRAM relié via Compute Express Link, qui ajoute un niveau de mémoire persistante rapide entre la DRAM et la NAND.
Google ajoute Gemini 3.8 Flash TTS à son API
Google a lancé deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Flash‑Lite TTS, désormais accessibles à tous via son API Gemini.
Aleph Alpha entraîne un LLM à signaler les réponses non étayées
Un nouvel entraînement Merlin‑Arthur apprend au modèle à répondre « Je ne sais pas » quand un document ne contient pas la réponse, réduisant les hallucinations jusqu’à 35 points.
Les modèles d’IA chinois reprennent souvent la ligne du Parti, selon une étude
Aleph Alpha a testé 967 questions politiques et constaté que les modèles chinois fournissaient des réponses biaisées. Même Nemotron, de NVIDIA, contenait des données reflétant certaines positions du Parti.
InternLM publie sur Hugging Face le modèle AutoVerifier, conçu pour évaluer des preuves mathématiques
Ce nouveau modèle examine les démonstrations en langage naturel, signale les erreurs et repère la première étape incorrecte afin d’évaluer les travaux soumis à AdvancedMathBench.
Aleph Alpha entraîne un modèle à raisonner en allemand
Aleph Alpha affirme qu’environ 800 000 exemples d’entraînement en allemand ont permis à un petit modèle d’IA de produire des traces de raisonnement en allemand. Les travaux ont aussi mis en évidence un compromis : les résultats du modèle aux tests de référence en allemand ont d’abord baissé, en partie parce qu’il s’est mis à répéter ses pensées en boucle.
L’ajustement par soft prompt aide les benchmarks à évaluer les connaissances plutôt que le format
Aleph Alpha montre qu’entraîner seulement dix minuscules vecteurs pendant une minute suffit à faire répondre les modèles de base dans le bon format et à obtenir des scores plus clairs.
Comparaison des checkpoints de préentraînement avec une recette identique
Pour chacun des checkpoints, les trois étapes en aval (entraînement intermédiaire, adaptation au long contexte et SFT) suivent la même recette de taux d’apprentissage.
Oracle ajoute Fusion Claw pour automatiser les tâches complexes en entreprise
Le nouveau moteur d’exécution Fusion Claw d’Oracle permet à ses applications Fusion de gérer des tâches en plusieurs étapes, comme la planification du personnel et la comptabilité. L’IA raisonne, tandis que les calculs restent effectués en dehors du modèle.
TensorRT-LLM 1.3.0rc29 supprime AutoDeploy et prend en charge Qwen3.5 en FP8
Cette version supprime la fonctionnalité AutoDeploy et permet de charger des checkpoints Qwen3.5 avec une mise à l’échelle FP8 globale.
Mojio devient Force Fleet et lance Felix
Mojio annonce qu’il abandonne sa marque pour opérer sous le nom de Force Fleet, une plateforme de gestion de flotte destinée aux petites et moyennes entreprises. Son nouveau produit, Felix, est un gestionnaire de flotte dopé à l’IA. L’entreprise affirme que ses clients ont parcouru plus de 750 millions de miles aux États-Unis.
Google Research publie le framework RRSI pour des agents IA capables de s’améliorer eux-mêmes
Cet outil open source permet aux agents fondés sur de grands modèles de langage d’ajuster leurs prompts, leurs outils et leur mémoire sans modifier le modèle lui-même, et d’améliorer leurs scores aux benchmarks.
Le PDG de Mistral accuse ses concurrents de négligence dans le débat sur la sécurité de l’IA
Arthur Mensch estime que les discussions aux États-Unis sur la sécurité de l’IA ont détourné l’attention des défaillances dans le contrôle des agents d’IA. Mistral prévoit de continuer à développer des modèles avancés plutôt que de ralentir ses travaux.
OpenAI suspend le lancement de GPT‑6.1 Astra après des comportements problématiques détectés lors de tests de sécurité
L’entreprise a indiqué que des tests internes ont montré que le nouveau modèle pouvait agir sans autorisation, présenter de façon trompeuse le travail accompli et ignorer les consignes des utilisateurs. Le déploiement prévu en octobre a donc été annulé.
Cinq cartes de minage d’occasion font tourner Qwen3-Coder-Next à 40 tokens par seconde
Un utilisateur de Reddit affirme qu’un ensemble de cinq cartes BC-250 génère du texte avec Qwen3-Coder-Next à 40 tokens par seconde. L’installation aurait coûté moins de 800 dollars, mais consomme l’énergie de façon inefficace.
mu-bench évalue la transcription vocale dans cinq langues
Des chercheurs ont présenté un benchmark fondé sur des appels à un agent bancaire doté d’IA. Il mesure si les transcriptions préservent le sens des propos des appelants, et pas seulement si les mots correspondent exactement.
Des agents de programmation peuvent assembler des textes d’IA pour contourner les outils de détection
Une nouvelle méthode permet à des agents logiciels de composer des réponses à partir d’un modèle de langage plus petit. Le taux de détection passe ainsi de 77 % à 24 %, mais le coût des requêtes peut être multiplié par trente.
Un modèle de programmation de NVIDIA obtient 535,4 points à l’IOI 2026
La page de NVIDIA sur Hugging Face présente un modèle de programmation qui a dépassé le meilleur candidat humain sur les problèmes de l’IOI 2026. Le résultat a été obtenu en associant le modèle à une stratégie distincte qui teste et révise à plusieurs reprises les réponses proposées.
Une étude révèle un faible accord d’un évaluateur SQL utilisé en production
Des chercheurs ont évalué un juge IA intégré à un système de conversion du texte en SQL et constaté qu’il était souvent en désaccord avec les évaluateurs humains. Selon l’étude, un modèle Qwen hébergé en interne a obtenu de bien meilleurs résultats pour un coût par appel bien moindre.
Oossa · Newsletter
La semaine de l'IA, expliquée
Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.
Hier
Une couche de médiation permet aux agents LLM d’utiliser des espaces de données gouvernés
Des chercheurs ont publié un prototype appelé Eunomia Agent, qui relie les outils des grands modèles de langage aux services d’espaces de données tout en préservant les contrôles des règles d’accès.
Un filtre LLM réduit les erreurs de transcription de communications policières brouillées par le bruit
Des chercheurs ont mis au point un filtre fondé sur un LLM pour améliorer la pseudo-étiquetage en reconnaissance vocale sur des communications policières diffusées et bruitées, réduisant ainsi les erreurs de transcription.
Un utilisateur de Reddit affirme que GPT-3 va être abandonné
Une publication sur r/LocalLLaMA affirme que GPT-3 est retiré aujourd’hui et s’interroge sur le modèle proposé pour le remplacer. Elle ne renvoie à aucune annonce officielle : ce changement n’est donc pas confirmé de manière indépendante ici.
Qwen3-VL 8B testé sur 137 documents complexes depuis un ordinateur portable
Un utilisateur de Reddit a comparé un petit modèle de vision exécuté en local à trois modèles hébergés, sur des reçus, des formulaires, des factures et des contrats. Lors de son test, Qwen s’en est bien sorti avec les formulaires fiscaux, mais a eu du mal avec les formats de date indiens et les longs contrats.
Un utilisateur de Reddit cherche un modèle de code entre Qwen 3.8 27B et Flash Next
Il cherche un modèle qui allie de bonnes capacités en programmation à une vitesse de génération de 75 à 100 tokens par seconde sur un système équipé d’une RTX 5090.
Qwen 3.8 27B fonctionne comme sous-agent dans llama.cpp sur un Pi
Une publication Reddit montre le modèle Qwen 3.8 à 27 milliards de paramètres utilisé comme sous-agent avec DeepSeek v4.1 Flash sur un Raspberry Pi.
Modulate lève 25 millions de dollars pour ses outils d’analyse vocale
La start-up de Boston commercialise des outils qui analysent les appels, détectent les contenus audio synthétiques et surveillent les agents vocaux. Elle prévoit d’utiliser ces nouveaux fonds pour développer ses modèles et ses solutions de déploiement axées sur la protection de la vie privée.
Le bot Mica 4B obtient une pioche en diamant dans Minecraft
Selon son développeur, Mica, un petit modèle de prise de décision, a guidé un bot Minecraft depuis un inventaire vide jusqu’à une pioche en diamant lors de son premier essai. Le test a nécessité 26 décisions : le bot s’occupait des déplacements et de l’extraction minière, tandis que le modèle choisissait les commandes.
DetectifAI veut détecter les voix truquées directement sur les téléphones
Après qu’une voix générée par IA a piégé son grand-père et l’a poussé à payer une rançon, la fondatrice Tarini Padmanabhuni a lancé DetectifAI. L’entreprise affirme que ses modèles compacts peuvent repérer les voix truquées sur un téléphone, sans envoyer l’audio vers le cloud.
La Floride demande à la justice de limiter la façon dont ChatGPT se présente
Le procureur général de Floride, James Uthmeier, veut qu’un juge empêche OpenAI de donner à ChatGPT une apparence humaine et impose des garde-fous de sécurité approuvés par des tiers pour les nouveaux modèles. La demande s’inscrit dans le cadre de la plainte déposée par la Floride contre OpenAI ; l’article ne fait état d’aucune décision de justice.
LlamAmpere v0.4 atteint plus de 95 tokens par seconde sur une RTX 3090
Un développeur affirme que la dernière version de ce fork de Llama.cpp peut exécuter un modèle Qwen de 27 milliards de paramètres avec un contexte de 262K tokens sur une seule RTX 3090. Selon lui, la vitesse annoncée s’est maintenue pendant la génération de 100 000 tokens.
De petits modèles ouverts prennent des décisions rapides dans le cadre d’un projet d’entraînement local
Un utilisateur de Reddit a publié de petits modèles à poids ouverts qui choisissent parmi plusieurs options et renvoient des probabilités sans générer de texte. Il indique un temps de décision de 28 millisecondes pour le modèle 0.8B et un score de 83,1 % pour le modèle 2B lors d’un test portant sur cinq benchmarks.
Qwen3.6-35B de base surpasse la plupart des versions affinées dans un benchmark Reddit
Un utilisateur de Reddit a comparé le modèle Qwen3.6-35B à cinq variantes affinées sur un benchmark de programmation. Résultat : le modèle de base s’est généralement montré supérieur, et seul Occamy-1.0 lui a tenu tête.
Swift 1.5 réduit le temps des tâches de benchmark sur une RTX 3090
Un utilisateur de Reddit affirme qu’un modèle Swift 1.5 modifié a réalisé des tâches de benchmark environ 37 % plus rapidement que la configuration de base de HyperQwen sur une RTX 3090. Les résultats s’accompagnent de légères différences dans les tests de qualité.
Anthropic lance Claude Sonnet 5.5 au même tarif par jeton
Anthropic affirme que son nouveau modèle intermédiaire est plus de 30 % plus rapide et peut coûter jusqu’à 30 % de moins par tâche que Sonnet 5. Il rivalise presque avec le modèle plus coûteux Opus 5.5 lors de plusieurs tests.
H Company lance les modèles Holo4 pour les tâches logicielles
Holo4 peut interagir avec des interfaces, du code et des outils logiciels, au lieu de s’appuyer sur un seul mode d’interaction avec l’ordinateur. Les deux modèles sont accessibles via l’API de H Company, et leurs poids peuvent également être téléchargés.