
مدلهای هوش مصنوعی در ماههای اخیر فقط به سمت بزرگتر شدن نرفتهاند؛ بخشی از تمرکز توسعهدهندگان روی این است که مدلها بتوانند کارهای پیچیده را بهصورت چندمرحلهای انجام دهند و در کنار پاسخ دادن، از ابزارهای مختلف نیز استفاده کنند.
Muse Glimmer 30B یکی از مدلهایی است که با همین هدف توسعه داده شده است. این مدل توسط Meta Superintelligence Labs ساخته شده و نسخه GGUF آن توسط Unsloth برای اجرای آسانتر روی سیستمهای محلی ارائه شده است.
Muse Glimmer حدود ۲۹.۶ میلیارد پارامتر دارد و علاوه بر متن، توانایی دریافت و تحلیل تصویر را نیز در اختیار دارد. تمرکز اصلی مدل روی کارهای Agentic، استدلال چندمرحلهای، برنامهنویسی، استفاده از ابزارها و انجام وظایف طولانی است.
تفاوت اصلی Muse Glimmer با بسیاری از مدلهای زبانی معمولی، تأکید آن بر انجام یک کار از ابتدا تا انتهاست.
در یک سیستم Agent، مدل باید بتواند یک هدف را به چند مرحله تقسیم کند، ابزار مناسب را انتخاب کند، نتیجه اجرای ابزار را بررسی کند و در صورت بروز مشکل، مسیر دیگری را امتحان کند.
Muse Glimmer برای چنین سناریوهایی آموزش و ارزیابی شده است. قابلیتهای مهم آن شامل استفاده از Function Calling، استدلال چندمرحلهای، تشخیص خطا و تلاش مجدد، اجرای وظایف طولانی و کار با محیطهای Agentic است.
برای مثال، در یک محیط برنامهنویسی، مدل میتواند کد را بررسی کند، دستوری را اجرا کند، خطای ایجادشده را ببیند و سپس تلاش کند مشکل را برطرف کند. این نوع عملکرد با چت ساده که در آن مدل فقط یک پاسخ متنی تولید میکند، تفاوت قابل توجهی دارد.
Muse Glimmer فقط یک مدل متنی نیست. این مدل یک Perception Encoder اختصاصی برای پردازش تصویر دارد و میتواند متن و تصویر را در یک مکالمه دریافت کند.
Encoder تصویری مدل حدود ۱.۸ میلیارد پارامتر دارد و بر پایه یک ViT-G/14 ساخته شده است. به همین دلیل Muse Glimmer میتواند مواردی مانند اسکرینشات، نمودار و اسناد تصویری را در کنار متن بررسی کند.
این قابلیت برای Agentها اهمیت زیادی دارد. یک دستیار هوشمند که قرار است با محیط دسکتاپ کار کند، همیشه با متن خام سروکار ندارد و ممکن است برای تصمیمگیری به تصویر صفحه، نمودار یا محتوای یک سند نیاز داشته باشد.
Muse Glimmer یک مدل Dense Causal Transformer است و از یک Encoder جداگانه برای درک تصویر استفاده میکند.
مشخصات اصلی مدل عبارتاند از:

در معماری مدل از ترکیبی از Attention محلی و سراسری استفاده شده و پنجره توجه محلی آن ۲۰۴۸ توکن است. این طراحی در کنار سایر بهینهسازیها به کاهش هزینه محاسبات کمک میکند.
یکی از نکات جالب Muse Glimmer برای کاربران Local AI، ارائه نسخههای کوانتایز شده در قالب GGUF است.
مدل اصلی حدود ۳۰ میلیارد پارامتر دارد و اجرای نسخه کامل آن به سختافزار قدرتمندی نیاز دارد. Unsloth با استفاده از کوانتایز کردن وزنها، اندازه مدل را به کمتر از ۲۰ گیگابایت رسانده است.
در صفحه مدل، دو پیکربندی اصلی برای اجرای محلی معرفی شده است:
K-Quant-Dynamic با هدف سیستمهای دارای حدود ۳۲ گیگابایت VRAM
K-Quant-17GB با هدف سیستمهای دارای حدود ۲۴ گیگابایت VRAM
طبق آزمایشهای منتشرشده، افت میانگین دقت در ۱۵ بنچمارک برای K-Quant-Dynamic حدود ۰.۲ درصد و برای K-Quant-17GB حدود ۱ درصد بوده است.
البته این اعداد به معنی آن نیست که یک کارت گرافیک ۱۷ یا ۲۴ گیگابایتی دقیقاً با همین میزان حافظه میتواند در همه شرایط مدل را بدون محدودیت اجرا کند. Context، حافظه KV Cache، Encoder تصویری و اجزای مربوط به شتابدهی نیز باید در محاسبه حافظه موردنیاز در نظر گرفته شوند.
Muse Glimmer همراه با یک مدل کوچکتر به نام DFlash ارائه شده است که برای Speculative Decoding استفاده میشود.
در حالت معمول، مدل زبانی توکنها را یکییکی تولید میکند. در روش Speculative Decoding، مدل کوچکتر ابتدا چند توکن را پیشنهاد میدهد و مدل اصلی آنها را بهصورت موازی بررسی میکند.
DFlash در Muse Glimmer میتواند بلوکهایی شامل ۱۶ توکن را پیشنهاد کند و مدل اصلی آنها را تأیید یا اصلاح کند. هدف، افزایش سرعت تولید بدون تغییر محسوس در کیفیت خروجی است.
در آزمایش منتشرشده توسط Unsloth، نسخه K-Quant-17GB روی RTX 5090 بدون speculative decoding به سرعت ۷۴.۹ توکن بر ثانیه رسیده است. با استفاده از DFlash، میانگین سرعت به ۲۳۳.۴ توکن بر ثانیه افزایش یافته که معادل حدود ۳.۱ برابر سرعت بیشتر است.
این اعداد مربوط به RTX 5090 و شرایط آزمایش سازنده هستند و نباید بهعنوان سرعت قابل انتظار روی کارتهای گرافیک دیگر در نظر گرفته شوند.
Muse Glimmer در چندین گروه از آزمونها با مدلهایی مانند Gemma 4-31B و Qwen 3.6-27B مقایسه شده است.
در برخی آزمونهای مرتبط با Agent عملکرد مدل قابل توجه بوده است. برای نمونه، امتیاز آن در MCP Atlas برابر ۷۵.۵، در DeepSearch QA برابر ۷۴.۶ و در SWE-Bench Verified برابر ۷۶ بوده است.
در آزمون AIME 2026 نیز امتیاز ۹۴.۷ و در GPQA Diamond امتیاز ۸۳.۵ گزارش شده است.
با این حال، Muse Glimmer در تمام آزمونها بهترین نتیجه را نداشته است. برای مثال، در برخی ارزیابیها Qwen 3.6-27B یا Gemma 4-31B عملکرد بالاتری داشتهاند. بنابراین بهتر است این مدل را یک گزینه قدرتمند در این رده بدانیم، نه مدلی که در همه زمینهها برتری مطلق دارد.
با توجه به معماری و نتایج منتشرشده، این مدل بیشتر برای کارهای زیر جذاب است:
Muse Glimmer برای کارهای مرتبط با کدنویسی، رفع خطا و انجام وظایف چندمرحلهای نرمافزاری آموزش و ارزیابی شده است.
اگر هدف ساخت دستیار هوشمندی باشد که بتواند از ابزارها استفاده کند و یک کار را در چند مرحله پیش ببرد، Muse Glimmer گزینه مناسبی برای آزمایش است.
توانایی پردازش تصویر باعث میشود مدل بتواند در کنار متن، اسکرینشات، نمودار و اسناد تصویری را نیز بررسی کند.
یکی از ویژگیهای مهم مدل این است که برای اجرای محلی بهینه شده و برای استفاده از آن الزاماً به سرویس ابری یا اتصال دائمی اینترنت نیاز نیست.
مدل برای Function Calling و اجرای زنجیرهای ابزارها طراحی شده است و این موضوع آن را برای پروژههایی که چند سرویس یا ابزار را به یک Agent متصل میکنند، مناسب میکند.
Muse Glimmer امکان تعیین میزان Reasoning را نیز در اختیار کاربر قرار میدهد.
چهار سطح برای این کار معرفی شده است:
Low، Medium، High و XHigh
در کارهای ساده میتوان از سطح پایینتر استفاده کرد تا پاسخ سریعتر تولید شود. برای برنامهنویسی، حل مسائل پیچیده و وظایف Agentic، سازندگان استفاده از High یا XHigh را پیشنهاد کردهاند.
برای تنظیمات تولید متن نیز مقادیر پیشنهادی Unsloth شامل temperature برابر 1.0، مقدار top_p برابر 0.95 و top_k برابر 64 است.
با وجود قابلیتهای متنوع، این مدل الزاماً بهترین انتخاب برای هر کاربری نیست.
اگر استفاده اصلی فقط چت، ترجمه یا تولید متن ساده باشد، مدلهای کوچکتر میتوانند سرعت و مصرف حافظه بهتری ارائه دهند. Muse Glimmer زمانی جذابتر میشود که کاربر واقعاً به ترکیبی از استدلال، برنامهنویسی، ابزارها و ورودی تصویری نیاز داشته باشد.
از طرف دیگر، اجرای نسخههای کوانتایز شده روی سختافزارهای ضعیفتر همچنان به مدیریت دقیق حافظه نیاز دارد. صرفاً کوچک شدن فایل مدل به حدود ۱۷ گیگابایت به این معنی نیست که تمام سیستمهای دارای ۱۶ گیگابایت VRAM قادر به اجرای کامل آن خواهند بود.
Muse Glimmer 30B را میتوان تلاشی برای نزدیک کردن مدلهای Agentic قدرتمند به سختافزارهای معمولیتر دانست.
این مدل علاوه بر تواناییهای زبانی، روی چند حوزه مهم تمرکز کرده است: استدلال چندمرحلهای، استفاده از ابزار، بازیابی از خطا، برنامهنویسی و درک تصویر.
ارائه نسخههای GGUF و کوانتایز شده نیز باعث شده Muse Glimmer برای کاربران Local AI جذابتر شود. در این میان، استفاده از DFlash برای Speculative Decoding نکته مهم دیگری است که میتواند سرعت تولید را در سختافزارهای مناسب به شکل محسوسی افزایش دهد.
در نهایت، ارزش واقعی Muse Glimmer بیشتر زمانی مشخص میشود که آن را بهعنوان یک مدل برای انجام کار ببینیم، نه صرفاً مدلی برای پاسخ دادن به سؤال. اگر هدف ساخت یک Agent محلی برای برنامهنویسی، کار با ابزارها و تحلیل همزمان متن و تصویر باشد، Muse Glimmer 30B یکی از مدلهایی است که ارزش امتحان کردن دارد.
منبع: صفحه رسمی Muse Glimmer 30B-GGUF در Hugging Face و مستندات منتشرشده توسط Unsloth.

phoenix 

Nazila77 