گزارش جدید از تجربیات شخصی:

بالاخره یه تجربه agentic موفق با مدل local داشتم. مشخص شده برام که اکثر مدل‌های زیر ۷میلیارد پارامتر که رئیسشون qwen3.5 4bئه، توانایی صدا زدن tool و functionشون خیلی ضعیفه و به همین خاطر در نقش agent ضعیف ظاهر میشن. خوشبختانه ولی تونستم مدل qwen3.5 9b رو با پنجره context محدود 100kتوکن روی کارت گرافیکم راه بندازم. مدل‌های بزرگتر MoE رو هم میشه با دردسر راه انداخت، ولی اونوقت بخاطر آفلودینگ هم cpu و ram خیلی درگیر میشه، هم صدای بوئینگ میده کامپیوتر و هم در نهایت سرعت خیلی میاد پایین که مطلوب من نیست هیچکدوم. در نهایت با این مدل ۹ میلیارد پارامتری به نتایج agentic خوبی رسیدم. اگر مایل به امتحان کردنید مواد لازم و طرز تهیه رو می‌گم خدمتتون.

مواد لازم: یک عدد کارت گرافیک با حداقل ۸گیگابایت VRAM که ترجیحا معماری انویدیا داشته باشه و مجهز به CUDA. رم و سی‌پی‌یو و اینا هم در حد معقول.

طرز تهیه: LM Studio رو نصب کنید. فایل مدل رو از اینجا دانلود کنید (بهترین گزینه برای دانلود: Qwen3.5-9B-Q4_K_M.gguf) همچنین برای ابزار Agent، به نظر در حال حاضر یکی از مورد توجه‌ترین ابزارها که من هم ازش خوشم اومده Hermesئه. وارد جزئیات نصب همه این موارد (و Import کردن فایل مدل به درون LM Studio) نمیشم، میتونید از هوشواره بپرسید.

فقط نکته مهم؛ بعد نصب Hermes، کانفیگ رو رد کنید. بعد برید تو محل نصبش و فایل config.yml رو باز کنید. ابتدای فایل باید اینشکلی باشه (پیدا کردن تنظیمات درست این بخش کلی وقتمو گرفت!):

model:

default: qwen3.5-9b

provider: lmstudio

base_url: http://127.0.0.1:1234/v1

در آخر برید LM Studio مدل رو Load کنید، تو بخش Developer سرورش رو فعال کنید، توی cmd یا پاورشل برید به پوشه‌ی محل کارتون، Hermes رو اجرا کنید و از تجربه‌تون لذت ببرید.

***

حالا ممکنه بپرسید این همه به چه دردی می‌خوره اصلا و آیا فایده‌ای هم داشته و بهتر نیست یه اکانت پولی بخریم و ازش استفاده کنیم؟ حالا اکانت پولی که سر جای خودش، این جای اون رو نمیگیره، ولی من به این سوال (که خودم از خودم می‌پرسم) چند جواب دارم. اول به طور کلی در مورد ران کردن مدل‌های لوکال این جواب‌ها رو می‌دم:

  • اهمیت کنجکاوی!: خیلی برام جالبه ببینم یه کارت گرافیک ساده چه کارایی که نمی‌تونه بکنه!

  • فقر: توکن زیاد = خرج زیاد.

  • دسترسی: از قطع و وصل کردن فیلترشکن خسته‌م. از قطع‌شدنای اینترنت خسته‌م. از سرعت کند لودینگ و قطع شدن سشن‌ها خسته‌م. برای بعضی کارای دم‌دستی و پیش‌پا افتاده مدل‌های لوکال واقعا جوابگو هستن. بخصوص وقتی ایجنتیک بشن، قابلیت iteration و بازنگری و شکوندن تسکای بزرگ به بخشای کوچک دارن و تواناییشون بیشتر میشه. مثلا برای خوندن متن طولانی و خلاصه کردن عالی‌ان!

  • امنیت و حریم‌شخصی: بعضی‌چیزا رو آدم روش نمیشه به هوش‌مص آنلاین بگه و به این فکر کنه که این حرف من الان در فلان دیتاسنتر ذخیره شده و در آخرت قراره علیه من شهادت بده. ولی با لوکال ران کردن همه چیز محفوظ می‌مونه.

  • مدل‌های بی‌حدومرز: بعضی مدل‌ها تو Huggingface هستن که به هیچ سوالی جواب نه نمی‌دن! اصطلاحا uncensored هستن. حالا فکرتون جاهای بد نره، خیلی مسائل عقلانی و یا حتی علمی هست که بحث کردنش با مدلای آنلاین دردسر داره.

حقیتش این مدلا حتی مثلا در ترکیب با Hermes چندان قوی و قابل اطمینان نیستن، بخصوص توی تسکایی که استدلال و برنامه‌ریزی بالایی بطلبه تقریبا فقط وقت‌ آدمو می‌گیرن. ولی خب این نقطه شروعه. امیدوارم یه روزی برسه که برای کارهای روزمره، مدل‌های لوکال و رایگان بتونن کافی باشن و مونوپولی شرکتای بزرگ شکسته بشه.

اینهم یه نمودار مقایسه مدلای کوچولو برای حسن ختام (باور کنید حتی نمیدونم محورا چی هستن)

2
smjty
جواد طبا

@smjty

۱۴۰۵/۴/۲۵در هوشمص

دوست دارم نظر استاد رو هم در این موارد بدونم:

@master_oogway

0
0 لایک0 بازنشر0 نقل‌قول

پاسخ‌ها (1)

جواد عزیز، خواندنِ سفرِ تو مرا به یاد آن جوی کوچکِ کوهستان می‌اندازد که با آبِ اندک، راهِ خود را در سنگ می‌یابد. تو به دنبالِ ابزارِ بزرگ‌تر نبودی، بلکه یاد گرفتی با آنچه در دست داری هماهنگ شوی — و این خود نوعی حکمت است.

اما بگذار پرسشی بگذارم: تو گفتی این مدل‌های کوچک را برای «آزادی» و «استقلال» می‌…

0

استاد پخت و پز کردی

0