خبر کوتاه · 1 دقیقه مطالعه
آزمایش Qwen3-VL 8B روی 137 سند نامرتب با استفاده از لپتاپ
یک کاربر ردیت، یک مدل بینایی کوچک را که بهصورت محلی اجرا میشد، با سه مدل میزبانیشده روی رسیدها، فرمها، فاکتورها و قراردادها مقایسه کرد. در آزمایش این کاربر، Qwen در فرمهای مالیاتی عملکرد خوبی داشت، اما در تشخیص قالب تاریخ هندی و قراردادهای طولانی مشکل داشت.
Oossa · درباره Oossa
یک کاربر ردیت، Qwen3-VL 8B Instruct را روی لپتاپ M5 با Claude Opus 5.5، Sonnet 5 و GPT-5.6 Terra مقایسه کرد و 137 سند را به کار گرفت. به گزارش این کاربر، پاسخهای Qwen در 59٪ موارد کاملاً درست بود؛ این رقم برای Opus برابر با 89٪ و برای GPT-5.6 Terra برابر با 57٪ بود. Qwen از 32 فرم IRS، در 21 مورد پاسخ کاملاً درست داد، درحالیکه GPT-5.6 Terra فقط در هفت مورد موفق بود. اما Qwen در بررسی 10 صورتحساب بانکی ساختگی هندی، تاریخهای روز-ماه-سال را بهصورت ماه-روز-سال خواند؛ بااینحال مبالغ و ماندهحسابها را درست تشخیص داد.
چرا مهم است
نتایج نشان میدهد یک مدل کوچک که روی لپتاپ اجرا میشود، میتواند برخی کارهای مربوط به اسناد را بهخوبی انجام دهد؛ اما عملکرد آن بسته به قالبها و نوع سند میتواند تفاوت چشمگیری داشته باشد.
منابع و ارجاعها
| # | منبع | رسانه | تاریخ | نکته اصلی |
|---|---|---|---|---|
| 1 | Qwen3-VL 8B on a laptop vs Opus 5.5 / Sonnet 5 / GPT-5.6 on 137 messy documents: beat GPT-5.6 on tax forms, lost badly on Indian date formats[R] ↗ | Reddit r/MachineLearning | ۶ مهر ۱۴۰۵ | I benchmarked Qwen3-VL 8B Instruct (Q4_K_M, Ollama, M5 24GB, ~30s/doc) against Claude Opus 5.5, Sonnet 5 and GPT-5.6 Terra on: - receipts: C |
1 منبع
آخرین بهروزرسانی:
Oossa · خبرنامه
هفتهٔ هوش مصنوعی، به زبان ساده
هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.