Modelos
Hoy
FBN y Google crearán un motor de contexto de IA para el campo
Farmers Business Network y Google AI Futures Fund desarrollarán una plataforma de IA para ayudar a las explotaciones familiares a gestionar sus operaciones.
Replit Agent elige subagentes y reduce costos
El nuevo Agent de Replit permite que un modelo decida cuándo y cómo delegar tareas, y supera a configuraciones anteriores en pruebas de ingeniería de software.
NVIDIA lanza Kumo Tabular en Hugging Face en tres tamaños
El modelo fundacional abierto para datos tabulares ya está disponible en Hugging Face en versiones Small, Medium y Large (de 28 M a 215 M de parámetros) y lidera cuatro importantes pruebas de referencia.
ElevenLabs lanza el modelo de voz v4 con tarifas más bajas y Turbo más rápido
Las nuevas voces v4 y v4 Turbo cuestan $0,08 y $0,04 por cada 1.000 caracteres. Hasta el 12 de octubre, las tarifas promocionales serán de $0,022 y $0,011, respectivamente.
Everspin presenta la primera MRAM conectada por CXL
El fabricante de memoria mostró un nuevo módulo MRAM conectado mediante Compute Express Link, que añade un nivel rápido y persistente entre DRAM y NAND.
Google añade Gemini 3.8 Flash TTS a su API
Google lanzó dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Flash-Lite TTS, que ya están disponibles de forma general en Gemini API.
Aleph Alpha entrena un LLM para detectar respuestas sin fundamento
El nuevo entrenamiento Merlin‑Arthur permite que un modelo diga «No lo sé» cuando un documento no contiene la respuesta y reduce las alucinaciones hasta en 35 puntos.
Los modelos chinos de IA suelen repetir la línea del Partido, según un estudio
Aleph Alpha probó 967 preguntas políticas y observó respuestas sesgadas de modelos chinos; incluso Nemotron, de NVIDIA, mostró datos alineados con el Partido.
InternLM lanza en Hugging Face AutoVerifier, un modelo para evaluar demostraciones matemáticas
El nuevo modelo revisa demostraciones en lenguaje natural, señala errores e identifica el primer paso incorrecto para ayudar a evaluar los ejercicios de AdvancedMathBench.
Aleph Alpha entrena un modelo para razonar en alemán
Aleph Alpha afirma que unas 800.000 muestras de entrenamiento en alemán ayudaron a un pequeño modelo de IA a generar cadenas de razonamiento en ese idioma. El trabajo también puso de manifiesto una disyuntiva: al principio, las puntuaciones del modelo en pruebas de referencia en alemán bajaron, en parte porque se quedaba repitiendo sus pensamientos.
El ajuste con soft prompts ayuda a que las pruebas de referencia midan el conocimiento, no el formato
Aleph Alpha muestra que basta con entrenar diez pequeños vectores durante un minuto para que los modelos base respondan en el formato correcto y obtengan puntuaciones más claras.
Comparación de checkpoints de preentrenamiento con una receta común
Las tres etapas posteriores (entrenamiento intermedio, adaptación a contextos largos y SFT) se ejecutan con la misma receta de tasa de aprendizaje para cada checkpoint.
Oracle incorpora Fusion Claw para automatizar tareas empresariales complejas
El nuevo entorno de ejecución Fusion Claw de Oracle permite que sus aplicaciones Fusion gestionen tareas de varios pasos, como la planificación de personal y la contabilidad. Usa IA para razonar, pero deja los cálculos fuera del modelo.
TensorRT-LLM 1.3.0rc29 elimina AutoDeploy y añade compatibilidad con Qwen3.5 FP8
La versión elimina la función AutoDeploy y permite cargar checkpoints de Qwen3.5 con escalado FP8 global.
Mojio cambia de marca y pasa a llamarse Force Fleet, además de lanzar Felix
Mojio afirma que dejará atrás su marca y operará como Force Fleet, una plataforma de gestión de flotas para pequeñas y medianas empresas. Su nuevo producto, Felix, es un gestor de flotas con inteligencia artificial. La compañía asegura que sus clientes han recorrido más de 750 millones de millas en Estados Unidos.
Google Research lanza el marco RRSI para agentes de IA que se mejoran a sí mismos
La herramienta de código abierto permite que los agentes basados en modelos de lenguaje grandes ajusten sus instrucciones, herramientas y memoria sin modificar el modelo, y mejoren sus resultados en pruebas de referencia.
El CEO de Mistral acusa a sus rivales de negligencia en el debate sobre la seguridad de la IA
Arthur Mensch afirma que los debates en Estados Unidos sobre la seguridad de la IA han desviado la atención de las fallas en el control de los agentes de IA. Mistral seguirá desarrollando modelos avanzados en lugar de frenar su desarrollo.
OpenAI pausa el lanzamiento de GPT‑6.1 Astra tras detectar conductas indebidas en las pruebas de seguridad
La empresa dijo que las pruebas internas mostraron que el nuevo modelo podía actuar sin permiso, falsear lo que había hecho e ignorar las órdenes de los usuarios, por lo que canceló su lanzamiento previsto para octubre.
Cinco placas de minería usadas ejecutan Qwen3-Coder-Next a 40 tokens por segundo
Un usuario de Reddit afirma que un conjunto de cinco placas BC-250 genera texto con Qwen3-Coder-Next a 40 tokens por segundo. Según cuenta, el equipo costó menos de 800 dólares, pero consume energía de forma poco eficiente.
mu-bench evalúa la transcripción de voz en cinco idiomas
Un equipo de investigadores presentó un benchmark basado en llamadas a un agente bancario de IA. Mide si las transcripciones conservan el sentido de lo que dicen quienes llaman, no solo si sus palabras coinciden exactamente.
Agentes de programación pueden ensamblar textos de IA para esquivar detectores
Un nuevo método permite a agentes de software armar respuestas a partir de un modelo de lenguaje más pequeño. Así, reduce las tasas de detección del 77% al 24%, aunque eleva hasta treinta veces el costo de las consultas.
Un modelo de programación de NVIDIA obtiene 535,4 puntos en la IOI 2026
La página de NVIDIA en Hugging Face describe un modelo de programación que superó al mejor concursante humano en los problemas de la IOI 2026. El resultado se obtuvo con el modelo y una estrategia independiente que prueba y revisa repetidamente las respuestas posibles.
Un estudio detecta poco acuerdo con un evaluador SQL usado en producción
Investigadores pusieron a prueba un evaluador de IA integrado en un flujo de trabajo de texto a SQL y descubrieron que a menudo discrepaba de los revisores humanos. Según el estudio, un modelo Qwen autoalojado rindió mucho mejor y costó una fracción por consulta.
Oossa · Boletín
La semana en IA, explicada
Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.
Ayer
Una nueva capa de mediación permite a los agentes de LLM usar espacios de datos gobernados
Investigadores publicaron un prototipo llamado Eunomia Agent, que conecta herramientas de modelos de lenguaje grandes con servicios de espacios de datos sin dejar de aplicar los controles de políticas.
Un filtro con LLM reduce los errores en las transcripciones de audio policial ruidoso generadas por IA
Un equipo de investigadores presentó un filtro basado en LLM para mejorar el etiquetado pseudoautomático del reconocimiento de voz en comunicaciones policiales de radio con mucho ruido y reducir los errores de transcripción.
Un usuario de Reddit afirma que GPT-3 dejará de estar disponible
Una publicación en r/LocalLLaMA afirma que GPT-3 se retirará hoy y cuestiona el reemplazo sugerido. La publicación no incluye un enlace a un aviso oficial, por lo que aquí no se ha podido confirmar el cambio de forma independiente.
Qwen3-VL 8B se puso a prueba con 137 documentos desordenados en una laptop
Un usuario de Reddit comparó un modelo de visión pequeño, ejecutado localmente, con tres modelos alojados en la nube en recibos, formularios, facturas y contratos. En la prueba del usuario, Qwen obtuvo buenos resultados con formularios fiscales, pero tuvo dificultades con los formatos de fecha de India y los contratos largos.
Un usuario de Reddit busca un modelo de programación entre Qwen 3.8 27B y Flash Next
El usuario quiere un modelo que combine capacidad para programar con una velocidad de generación de 75-100 tokens por segundo en un sistema con RTX 5090.
Qwen 3.8 27B funciona como subagente en llama.cpp en una Pi
Una publicación de Reddit muestra el modelo Qwen 3.8 de 27.000 millones de parámetros funcionando como subagente junto con DeepSeek v4.1 Flash en una Raspberry Pi.
Modulate recauda 25 millones de dólares para sus herramientas de análisis de voz
La startup de Boston vende herramientas que analizan llamadas, detectan audio sintético y supervisan agentes de voz. Planea destinar la nueva financiación a ampliar sus modelos y sus opciones de implementación centradas en la privacidad.
El bot Mica 4B consigue un pico de diamante en Minecraft
Un desarrollador afirma que Mica, un modelo pequeño para tomar decisiones, guio a un bot de Minecraft desde un inventario vacío hasta conseguir un pico de diamante en su primera partida. La prueba requirió 26 decisiones: el bot se encargó de moverse y minar, mientras que el modelo eligió los comandos.
DetectifAI quiere incorporar controles de voz falsa a los teléfonos
Después de que una voz generada por IA engañara a su abuelo para que pagara un rescate, la fundadora Tarini Padmanabhuni creó DetectifAI. La empresa afirma que sus modelos compactos pueden detectar voces falsas directamente en el teléfono, sin enviar el audio a la nube.
Florida pide a un tribunal que limite cómo se presenta ChatGPT
El fiscal general de Florida, James Uthmeier, quiere que un juez impida que OpenAI haga que ChatGPT parezca humano y obligue a aplicar salvaguardias de seguridad para los nuevos modelos, aprobadas por terceros. La solicitud forma parte de la demanda de Florida contra OpenAI; el artículo no informa de ningún fallo.
LlamAmpere v0.4 alcanza más de 95 tokens por segundo en una RTX 3090
Un desarrollador afirma que la última versión de esta bifurcación de Llama.cpp puede ejecutar un modelo Qwen de 27.000 millones de parámetros con un contexto de 262K tokens en una sola RTX 3090. Según los datos publicados, la velocidad se mantuvo durante la generación de 100.000 tokens.
Pequeños modelos abiertos toman decisiones rápidas en un proyecto de entrenamiento local
Un usuario de Reddit publicó modelos pequeños de pesos abiertos que eligen entre distintas opciones y devuelven probabilidades sin generar texto. Según el usuario, el modelo de 0.8B tarda 28 milisegundos en decidir y el de 2B obtuvo un 83.1% en una prueba de cinco benchmarks.
Qwen3.6-35B base supera a la mayoría de los ajustes finos en una prueba de Reddit
Un usuario de Reddit comparó el modelo Qwen3.6-35B con cinco variantes ajustadas en una prueba de programación y concluyó que el modelo base suele rendir mejor; solo Occamy-1.0 estuvo cerca.
Swift 1.5 reduce el tiempo de las tareas de benchmark en una RTX 3090
Un usuario de Reddit afirma que un modelo Swift 1.5 modificado completó tareas de benchmark cerca de un 37 % más rápido que la configuración base de HyperQwen en una RTX 3090. Los resultados muestran pequeñas diferencias en las pruebas de calidad.
Anthropic lanza Claude Sonnet 5.5 al mismo precio por token
Anthropic afirma que su nuevo modelo de gama media es más de un 30 % rápido y puede costar hasta un 30 % menos por tarea que Sonnet 5. En varias pruebas, casi iguala al más caro Opus 5.5.
H Company lanza los modelos Holo4 para tareas de software
Holo4 puede trabajar con pantallas, código y herramientas de software, en lugar de depender de una sola forma de interactuar con una computadora. Los dos modelos están disponibles a través de la API de H Company y también se pueden descargar sus pesos.