简讯 · 1 分钟阅读
用笔记本电脑测试 Qwen3-VL 8B:处理 137 份杂乱文档
一位 Reddit 用户将本地运行的小型视觉模型与三款托管模型进行比较,测试材料包括收据、表格、发票和合同。根据这位用户的测试,Qwen 处理税务表格表现不错,但难以应对印度日期格式和长篇合同。
Oossa · 关于 Oossa
一位 Reddit 用户在 M5 笔记本电脑上测试了 Qwen3-VL 8B Instruct,并将其与 Claude Opus 5.5、Sonnet 5 和 GPT-5.6 Terra 进行比较,共使用了 137 份文档。该用户称,Qwen 的结果中有 59% 完全正确;Opus 为 89%,GPT-5.6 Terra 为 57%。Qwen 准确处理了 32 份 IRS 表格中的 21 份,而 GPT-5.6 Terra 只处理对了 7 份。不过,在 10 份合成的印度银行对账单中,Qwen 把“日-月-年”格式的日期读成了“月-日-年”,尽管金额和余额都识别正确。
为什么重要
测试结果表明,在笔记本电脑上运行的小型模型能够胜任部分文档处理任务,但其表现会因格式和文档类型不同而有很大差异。
这篇文章有帮助吗?
来源与参考
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | Qwen3-VL 8B on a laptop vs Opus 5.5 / Sonnet 5 / GPT-5.6 on 137 messy documents: beat GPT-5.6 on tax forms, lost badly on Indian date formats[R] ↗ | Reddit r/MachineLearning | 2026年9月28日 | I benchmarked Qwen3-VL 8B Instruct (Q4_K_M, Ollama, M5 24GB, ~30s/doc) against Claude Opus 5.5, Sonnet 5 and GPT-5.6 Terra on: - receipts: C |
1 个来源
最后更新:
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。