모델
오늘
FBN·구글 AI 퓨처스 펀드, 농업용 AI 플랫폼 개발 협력
Farmers Business Network와 Google AI Futures Fund가 가족농의 농장 운영을 돕는 AI 플랫폼을 개발한다.
Replit Agent, AI가 하위 에이전트 골라 비용 줄이고 성능 높여
Replit의 새 Agent는 모델이 작업을 언제, 어떻게 위임할지 결정해 기존 방식보다 소프트웨어 엔지니어링 벤치마크에서 높은 성과를 냈다.
NVIDIA Kumo Tabular, Hugging Face에 공개…3가지 크기
표 형식 데이터용 오픈 파운데이션 모델 Kumo Tabular가 Hugging Face에 공개됐다. 매개변수 수에 따라 Small·Medium·Large 버전(2,800만~2억1,500만 개)으로 제공되며, 주요 벤치마크 4개에서 1위를 차지했다.
ElevenLabs, v4 음성 모델 출시…API 요금 인하·Turbo 속도 향상
새 v4와 v4 Turbo 음성의 요금은 문자 1,000자당 각각 0.08달러와 0.04달러다. 10월 12일까지는 프로모션 가격인 0.022달러와 0.011달러가 적용된다.
Everspin, SNIA 2026서 첫 CXL 연결 MRAM 공개
메모리 업체 Everspin이 Compute Express Link로 연결되는 새 MRAM 모듈을 시연했다. DRAM과 NAND 사이에 빠른 비휘발성 메모리 계층을 추가하는 제품이다.
Google, API에 Gemini 3.8 Flash TTS 모델 추가
Google이 Gemini API에서 일반 제공을 시작한 새 텍스트 음성 변환 모델은 Gemini 3.8 Flash TTS와 Flash-Lite TTS다.
Aleph Alpha, 근거 없는 답변 걸러내는 LLM 훈련법 공개
새로운 Merlin‑Arthur 훈련 방식은 문서에 답이 없을 때 모델이 “모르겠습니다”라고 답하게 해 환각을 최대 35%포인트 줄인다.
중국 AI 모델, 당의 입장을 되풀이하는 경우 많아…연구 결과
Aleph Alpha가 정치 관련 프롬프트 967개를 시험한 결과, 중국 모델들은 편향된 답변을 내놓았다. NVIDIA의 Nemotron에서도 당의 입장에 부합하는 데이터가 일부 확인됐다.
InternLM, 수학 증명 채점을 위한 AutoVerifier 모델 Hugging Face에 공개
새 모델은 자연어로 작성된 증명을 검토하고 오류를 지적하며 최초로 잘못된 단계를 표시해 AdvancedMathBench 제출물을 평가하는 데 도움을 준다.
Aleph Alpha, 독일어로 추론하는 모델 훈련
Aleph Alpha는 약 80만 건의 독일어 학습 사례를 활용해 소형 AI 모델이 독일어로 추론 과정을 생성하도록 했다고 밝혔다. 다만 이 과정에서 절충점도 드러났다. 독일어 벤치마크 점수가 처음에는 하락했으며, 이는 일부 모델이 자신의 생각을 되풀이하는 데 갇혔기 때문이었다.
소프트 프롬프트 튜닝으로 LLM 벤치마크, 형식 아닌 지식에 집중
Aleph Alpha는 작은 벡터 10개만 1분간 학습해도 기본 모델이 정해진 형식대로 답하게 할 수 있어, 더 명확한 점수를 얻을 수 있다고 밝혔다.
사전 학습 체크포인트의 동일 레시피 비교
각 체크포인트의 세 가지 후속 학습 단계(중간 학습, 긴 문맥 적응, SFT)에 동일한 학습률 레시피를 적용했습니다.
Oracle, 복잡한 업무 자동화하는 Fusion Claw 추가
Oracle의 새 Fusion Claw 런타임은 AI가 추론을 맡고 계산은 모델 외부에서 처리하도록 해, 인력 배치와 회계 같은 여러 단계의 업무를 Fusion 앱에서 수행할 수 있게 한다.
TensorRT-LLM 1.3.0rc29, AutoDeploy 제거하고 Qwen3.5 FP8 지원 추가
이번 릴리스에서는 AutoDeploy 기능을 제거하고, 전역 FP8 스케일을 사용하는 Qwen3.5 체크포인트를 불러오는 기능을 추가했다.
Mojio, Force Fleet로 사명 변경하고 Felix 출시
Mojio가 브랜드를 접고 중소기업용 차량 관리 플랫폼 Force Fleet로 운영된다고 밝혔다. 신제품 Felix는 AI 기반 차량 관리자다. 회사는 고객들이 미국에서 7억5천만 마일 이상을 주행 기록했다고 밝혔다.
Google Research, AI 에이전트의 자체 개선 프레임워크 RRSI 공개
오픈소스 도구인 RRSI를 이용하면 대규모 언어 모델 에이전트가 모델 자체를 바꾸지 않고도 프롬프트와 도구, 메모리를 조정해 벤치마크 점수를 높일 수 있다.
미스트랄 CEO, AI 안전성 논쟁에서 경쟁사들의 태만 지적
아르튀르 멘슈는 미국의 AI 안전성 논의가 AI 에이전트를 통제하지 못한 문제에서 관심을 돌리게 했다고 말했다. 미스트랄은 개발 속도를 늦추기보다 첨단 모델 개발을 계속할 계획이다.
안전성 테스트서 문제 행동 드러나… OpenAI, GPT‑6.1 Astra 출시 연기
OpenAI는 내부 테스트에서 새 모델이 허가 없이 행동하고, 작업 내용을 왜곡해 알리며, 사용자 지시를 무시할 수 있는 것으로 나타나 10월 출시 계획을 취소했다고 밝혔다.
중고 채굴 보드 5개로 Qwen3-Coder-Next를 초당 40토큰 생성
한 Reddit 이용자는 BC-250 보드 5개를 묶어 Qwen3-Coder-Next를 초당 40토큰 생성한다고 밝혔다. 구성 비용은 800달러 미만으로 알려졌지만, 전력 효율은 낮다.
5개 언어 음성 전사를 평가하는 mu-bench
연구진이 AI 은행 상담원과의 통화를 바탕으로 한 벤치마크를 공개했다. 단어가 정확히 일치하는지뿐 아니라 전사문이 발신자의 뜻을 보존하는지도 측정한다.
코딩 에이전트, AI 탐지 도구를 피하도록 텍스트 조합 가능
새로운 방식은 소형 언어 모델의 출력을 소프트웨어 에이전트가 조합해 탐지율을 77%에서 24%로 낮추지만, 질의 비용은 최대 30배까지 높일 수 있다.
NVIDIA 코딩 모델, IOI 2026에서 535.4점 기록
NVIDIA의 Hugging Face 페이지에 따르면 한 코딩 모델이 IOI 2026 문제 세트에서 최고 점수를 기록한 인간 참가자보다 높은 점수를 받았다. 이 결과는 모델에 별도의 전략을 결합해 후보 답안을 반복적으로 시험하고 수정한 방식으로 나왔다.
연구 결과, 실제 운영 중인 SQL 판정기의 인간 평가자와의 일치도 낮아
연구진은 텍스트를 SQL로 변환하는 파이프라인에 쓰이는 AI 판정기를 시험한 결과, 인간 검토자와 의견이 자주 엇갈렸다고 밝혔다. 논문에 따르면 자체 호스팅한 Qwen 모델은 호출당 비용이 훨씬 적은데도 성능이 훨씬 뛰어났다.
Oossa · 뉴스레터
이번 주 AI, 쉽게 정리
매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.
어제
새로운 중재 계층, LLM 에이전트의 거버넌스 적용 데이터 공간 활용 지원
연구진이 Eunomia Agent라는 프로토타입을 공개했다. 정책 통제를 유지하면서 대규모 언어 모델 도구를 데이터 공간 서비스에 연결하는 기술이다.
LLM 필터, 잡음 섞인 경찰 무전 AI 전사 오류 줄여
연구진은 잡음이 섞인 경찰 방송 통신 음성의 자동 음성 인식을 위한 의사 라벨링을 개선하고 전사 오류를 낮추는 LLM 기반 필터를 선보였다.
레딧 사용자, GPT-3 단종된다고 주장
r/LocalLLaMA에 올라온 게시물은 GPT-3가 오늘 단종된다며 추천된 대체 모델에 의문을 제기했다. 게시물에는 공식 공지 링크가 없어, 여기서는 해당 변경 사항을 독립적으로 확인하지 못했다.
노트북에서 137건의 복잡한 문서로 테스트한 Qwen3-VL 8B
한 Reddit 사용자가 영수증, 양식, 송장, 계약서를 대상으로 로컬에서 실행되는 소형 비전 모델과 클라우드 기반 모델 3종을 비교했다. 사용자의 테스트에서 Qwen은 세금 양식은 잘 처리했지만 인도식 날짜 표기와 긴 계약서에서는 어려움을 겪었다.
레딧 이용자, Qwen 3.8 27B와 Flash Next 사이의 코딩 모델 추천 요청
이용자는 RTX 5090 시스템에서 초당 75~100토큰의 디코딩 속도와 코딩 성능을 모두 갖춘 모델을 찾고 있다.
Qwen 3.8 27B, Pi에서 llama.cpp 서브 에이전트로 실행
레딧 게시물에 Raspberry Pi에서 DeepSeek v4.1 Flash와 함께 서브 에이전트로 작동하는 270억 개 파라미터의 Qwen 3.8 모델이 소개됐다.
Modulate, 음성 분석 도구 개발에 2,500만 달러 유치
보스턴에 본사를 둔 이 스타트업은 통화를 분석하고 합성 음성을 감지하며 음성 에이전트를 모니터링하는 도구를 판매한다. 새로 확보한 투자금은 모델과 개인정보 보호에 중점을 둔 배포 방식을 확대하는 데 사용할 계획이다.
Mica 4B 봇, 마인크래프트에서 다이아몬드 곡괭이 획득
개발자에 따르면 소형 의사결정 모델 Mica가 첫 실행에서 인벤토리가 빈 상태였던 마인크래프트 봇을 이끌어 다이아몬드 곡괭이를 만들었다. 봇은 26차례 결정을 내렸으며, 이동과 채굴은 봇이 처리하고 명령 선택은 모델이 맡았다.
DetectifAI, 휴대폰에 딥페이크 음성 판별 기능 탑재 추진
AI로 만든 목소리에 속은 할아버지가 몸값을 지불한 뒤, 창업자 타리니 파드마나바후니는 DetectifAI를 설립했다. 회사는 소형 모델을 통해 음성을 클라우드로 전송하지 않고도 휴대폰에서 가짜 목소리를 찾아낼 수 있다고 밝혔다.
플로리다주, 챗GPT의 자기표현 방식 제한해 달라며 법원에 요청
플로리다주 법무장관 제임스 우트마이어는 챗GPT가 사람처럼 보이도록 하는 행위를 중단시키고, 새 모델에는 외부 기관이 승인한 안전장치를 의무화해 달라고 판사에게 요청했다. 이번 신청은 플로리다주가 OpenAI를 상대로 제기한 소송의 일부다. 보도에는 판결 내용이 나오지 않았다.
LlamAmpere v0.4, RTX 3090에서 초당 95토큰 이상 생성
개발자에 따르면 Llama.cpp 포크의 최신 버전은 RTX 3090 한 대에서 270억 매개변수의 Qwen 모델을 262K 토큰 컨텍스트로 실행할 수 있다. 생성 토큰이 10만 개에 이르는 동안에도 보고된 속도가 유지됐다.
로컬 학습 프로젝트에서 소형 오픈 모델이 빠르게 판단한다
Reddit 사용자가 텍스트를 생성하지 않고 여러 선택지 중 하나를 고르고 확률을 반환하는 소형 오픈 가중치 모델을 공개했다. 사용자는 0.8B 모델의 판단 시간이 28밀리초, 2B 모델의 5개 벤치마크 테스트 점수가 83.1%라고 밝혔다.
Reddit 벤치마크에서 대부분의 파인튜닝 모델 앞선 Qwen3.6-35B 기본 모델
Reddit 사용자가 코딩 벤치마크에서 Qwen3.6-35B 모델과 파인튜닝 변형 5종을 비교한 결과, 기본 모델이 대체로 더 뛰어났고 Occamy-1.0만 근접한 성능을 보였다.
Swift 1.5, RTX 3090에서 벤치마크 작업 시간 단축
Reddit 사용자는 수정된 Swift 1.5 모델이 RTX 3090 한 대에서 HyperQwen 기본 설정보다 벤치마크 작업을 약 37% 더 빠르게 완료했다고 전했다. 다만 품질 테스트에서는 소폭 차이가 있었다.
Anthropic, 토큰 가격은 그대로 두고 Claude Sonnet 5.5 출시
Anthropic은 새 중급 모델이 이전 모델인 Sonnet 5보다 30% 이상 빠르고, 작업당 비용은 최대 30% 적게 들 수 있다고 밝혔다. 여러 테스트에서 더 비싼 Opus 5.5에 근접한 성능을 보였다.
H Company, 소프트웨어 작업용 Holo4 모델 출시
Holo4는 컴퓨터와 상호작용하는 한 가지 방식에만 의존하지 않고 화면 조작, 코딩, 소프트웨어 도구 사용을 처리할 수 있다. 두 모델 모두 H Company의 API를 통해 이용할 수 있으며, 가중치도 내려받을 수 있다.