
مدلهای هوش مصنوعی حافظه زیادی مصرف میکنند. یک مدل هوش مصنوعی ۲۷ میلیارد پارامتری، که طبق استانداردهای صنعتی متوسط محسوب میشود، برای اجرا با دقت نصف به تقریباً ۵۴ گیگابایت حافظه نیاز دارد. اکثر لپتاپها نمیتوانند این مقدار را در خود جای دهند. حتی برخی از سیستمهای دسکتاپ نیز قادر به این کار نیستند.
اوایل این هفته، PrismML مدلی را با حجم ۳.۹ گیگابایت منتشر کرد – به اندازه کافی کوچک که روی آیفون جا شود.
پارامترها، تعداد تنظیمات و تغییراتی هستند که یک مدل میتواند مدیریت کند. هرچه پارامترها بیشتر باشند، مدل متراکمتر و توانمندتر است.
Bonsai 27B اولین مدل کلاس ۲۷B است که محدودیت حافظه یک گوشی هوشمند مصرفکننده را پشت سر گذاشته و با سرعت ۱۱ توکن در ثانیه روی آیفون ۱۷ پرو مکس اجرا میشود. (توکنها واحدهای اساسی اطلاعاتی هستند که مدلهای هوش مصنوعی میتوانند مدیریت و تولید کنند.) نسخه سه حالته، با ۵.۹ گیگابایت، حدود ۲۶ توکن در ثانیه را روی لپتاپ M5 Pro به دست میآورد. هر دو تحت مجوز Apache 2.0 رایگان هستند.
روش فشردهسازی، که بر اساس مالکیت فکری کلتک ساخته شده است، هر وزن مدل را از ۱۶ بیت دقت ممیز شناور به یک علامت واحد کاهش میدهد – در ساختار باینری، +۱ یا -۱، و در ساختار سه حالته، یکی از سه مقدار. هر گروه ۱۲۸ وزنی، یک عامل مقیاسگذاری ۱۶ بیتی را به اشتراک میگذارد که نسخه باینری را به ۱.۱۲۵ بیت در هر وزن میرساند: ۱۴ برابر کوچکتر از نسخه اصلی با دقت کامل. مدل سه حالته یک وضعیت صفر را برای قدرت بیان کمی بیشتر اضافه میکند و در ۱.۷۱ بیت قرار میگیرد.
به عبارت سادهتر، این بدان معناست که یک مدل هوش مصنوعی سه حالته فقط از سه تنظیم برای هر مقدار داخلی استفاده میکند – منفی، صفر یا مثبت – در حالی که یک هوش مصنوعی استاندارد میتواند از حدود ۶۵۰۰۰ تنظیم انتخاب کند.
PrismML این کار را بدون از دست دادن کیفیت خروجی انجام داد.
آنچه این مدل را از مدلهای "بیت پایین" معمولی متمایز میکند این است که هیچ بخش با دقت بالاتری به عنوان یک دریچه فرار باقی نمیماند: امبدینگها، مکانیسم توجه و کل هد مدل زبان همگی به صورت سرتاسری فشرده شدهاند. اکثر ساختارهای کوانتیزه شده، برخی لایههای حساس را با دقت کامل حفظ میکنند که در نهایت به عنوان یک معاوضه برای کیفیت بهتر، اندازه آنها را افزایش میدهد. Bonsai این بازی را انجام نمیدهد.
این دومین انتشار بزرگ در این خانواده است. در ماه مارس، PrismML مدل Bonsai 8B، یک مدل ۱.۱۵ گیگابایتی را عرضه کرد که ثابت کرد معماری ۱-بیتی میتواند در ۸ میلیارد پارامتر بدون فروپاشی استدلال خود دوام بیاورد. جهش به ۲۷ میلیارد جایی است که stakes تغییر میکند – این مقیاس جایی است که استدلال زنجیره فکری پایدار، استفاده قابل اعتماد از ابزار و رفتار عاملی چند مرحلهای واقعاً به طور مداوم ظاهر میشود – چیزهایی که مدلهای کوچکتر هنوز در آنها لنگ میزنند.
در ۱۵ بنچمارک ارزیابی شده در حالت تفکر بر روی پردازندههای گرافیکی NVIDIA H100 – شامل دانش، ریاضیات، کدنویسی و استفاده از ابزار – Ternary Bonsai 27B به طور متوسط ۸۰.۴۹ امتیاز کسب میکند، یا ۹۴.۶٪ از مدل با دقت کامل. نسخه ۱-بیتی به ۷۶.۱۱ میرسد.
به طور کلی، در بنچمارکها، این مدلها از Gemma 4 یا Qwen 3.6 از نظر پتانسیلی که برای اندازه خود ارائه میدهند، بسیار بهتر عمل میکنند.
این مدلها با توجه به آنچه ارائه میدهند، بسیار خوب عمل میکنند، و با توجه به منابع کمی که نیاز دارند، سختافزارهای کوچک (گوشیهای هوشمند و رایانههای شخصی پایینرده) را از نظر قابلیتها به سطح دیگری میبرند. AIME25 و AIME26، که بر اساس آزمون ریاضیات دعوتی آمریکا مدلسازی شدهاند، برای Ternary Bonsai 27B ۹۳.۷٪ در مقابل ۹۵.۳٪ برای Qwen 3.6B بسیار بزرگتر است. Bonsai در کدنویسی ۸۶ امتیاز در مقابل ۸۸ امتیاز Qwen 3.6 و در دانش عمومی ۷۷٪ در مقابل ۸۳٪ برای Qwen 3.6 کسب میکند.
این مدل همچنین از یک زیرساخت توجه ترکیبی استفاده میکند که تقریباً ۷۵٪ از لایههای آن خطی هستند به جای توجه کاملاً کوادراتیک. این معماری چیزی است که پنجره متنی ۲۶۲ هزار توکنی را روی دستگاه عملی میکند – چیزی که یک پشته توجه استاندارد آن را بر روی سختافزار گوشی به شدت گران تمام میکند.
ما خودمان Bonsai 27B را اجرا کردیم. کدنویسی نیاز به تکرار دارد: پرامپتهای تکشات با مدلهای ابری پیشرفته رقابت نمیکنند. محلی و رایگان بودن این موضوع را بیاهمیت میکند. برای بازی Zombie Type ما – یک بازی مرورگر ترسناک تایپی اول شخص – دو دور کدنویسی ویژوال (vibe coding) تشخیص برخورد تمیز، منطق امتیازدهی مناسب و گرافیک یکپارچه را تولید کرد. مدل ساختار را زود درک میکند؛ مرحله دوم به جای بازسازی، آن را اصلاح میکند.
جالب اینجاست که برخی از مدلها (مانند اسکلتها) پیچیدهتر از مدلهای GPT 5.6 Sol به نظر میرسیدند. این به هیچ وجه به معنای بهتر بودن نیست، فقط در این وظیفه یک اسکلت زیبا تولید کرد، در حالی که پادشاه هوش مصنوعی انتخاب سبکی ضعیفتری داشت.
بازی برای آزمایش در اینجا در دسترس است.
نوشتن خلاقانه داستانی پیچیدهتر است و معیارهای آن ذهنیتر هستند.
به طور کلی، اگر پرامپت یکبار مصرفی در ذهن داشته باشید، نتایج به طور خاص تخیلی نیستند.
با این حال، Bonsai داستانهایی با منطق داخلی، ریتم و قوس ثابت تولید میکند – بهتر، یا همتراز با Claude Haiku یا حتی Sonnet با تلاش کمتر در پرامپتهای مشابه. برای مدلی که کاملاً روی سختافزار خودتان و بدون هزینههای API اجرا میشود، این حرف زیادی است.
داستانی که این مدل ایجاد کرده است را میتوانید در مخزن گیتهاب ما پیدا کنید.
PrismML همچنین یک لایه رمزگشایی گمانهزن DSpark را در کنار مدل ارائه میدهد – یک پیشنویسساز سبکوزن که بلوکهایی از توکنهای نامزد را پیشنهاد میکند، که مدل اصلی آنها را در یک گذر پیشرو واحد تأیید میکند نه اینکه توکن به توکن تولید کند. روی H100 این امر ۱.۳۷ برابر افزایش توان عملیاتی را بدون تغییر در کیفیت خروجی به ارمغان میآورد، زیرا تأیید توزیع دقیق خروجی را حفظ میکند. روی Apple Silicon هنوز به طور پیشفرض فعال نیست، اما برای سرویسدهی GPU یک دستاورد واقعی است.
علاقه اپل بُعد تجاری به این موضوع اضافه میکند. بابک حسیبی، مدیرعامل PrismML، به CNBC تأیید کرد که این شرکت در حال مذاکرات اولیه با اپل است، که در حال ارزیابی فناوری فشردهسازی برای استفاده احتمالی روی دستگاه است.
حسیبی گفت که مدل فشرده شده Gemma پروژه بعدی در دستور کار است، و سپس مدلهای پیشرفتهتر و بزرگتر. Bonsai 27B 1-بیتی اکنون به صورت رایگان تحت مجوز Apache 2.0 قابل دانلود است. اگر به راهنمایی برای اجرای مدلهایی مانند این به صورت محلی نیاز دارید، راهنمای ما را بررسی کنید.