短信 · 1 分で読める
ノートPCで137件の雑多な文書をQwen3-VL 8Bに読み取らせて検証
Redditユーザーが、ローカルで動作する小型の視覚モデルと、ホスト型モデル3種を使い、レシートや各種書類、請求書、契約書を比較した。ユーザーのテストでは、Qwenは税務書類の処理で好成績だった一方、インド式の日付表記や長い契約書には苦戦した。
Oossa · Oossaについて
Redditユーザーは、137件の文書を使い、M5搭載ノートPCで動作するQwen3-VL 8B InstructをClaude Opus 5.5、Sonnet 5、GPT-5.6 Terraと比較した。投稿によると、文書の内容を完全に正しく読み取れた割合は、Qwenが59%、Opusが89%、GPT-5.6 Terraが57%だった。QwenはIRSの書類32件のうち21件を完全に正しく処理したのに対し、GPT-5.6 Terraは7件だった。一方、インドの銀行取引明細書を模した10件では、金額と残高は正しく読み取ったものの、日-月-年の順の日付を月-日-年として解釈した。
なぜ重要か
今回の結果は、ノートPCで動く小型モデルでも一部の文書処理をうまくこなせる一方、書式や文書の種類によって性能が大きく変わることを示している。
この記事は役に立ちましたか?
出典と参考資料
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | Qwen3-VL 8B on a laptop vs Opus 5.5 / Sonnet 5 / GPT-5.6 on 137 messy documents: beat GPT-5.6 on tax forms, lost badly on Indian date formats[R] ↗ | Reddit r/MachineLearning | 2026/09/28 | I benchmarked Qwen3-VL 8B Instruct (Q4_K_M, Ollama, M5 24GB, ~30s/doc) against Claude Opus 5.5, Sonnet 5 and GPT-5.6 Terra on: - receipts: C |
1 件の出典
最終更新:
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。