صفحه اصلیمرکز اخبار LBank
با بونسای آشنا شوید: اولین مدل هوش مصنوعی ۲۷B که روی گوشی شما قابل اجراست
meet-bonsai-first-27b-ai-model-fits-phone
با بونسای آشنا شوید: اولین مدل هوش مصنوعی ۲۷B که روی گوشی شما قابل اجراست
Bonsai 27B از PrismML هوش مصنوعی با قابلیت استدلال کامل را به صورت رایگان روی آیفون اجرا می‌کند. ما آن را آزمایش کردیم و به همان اندازه که به نظر می‌رسد، چشمگیر است.
2026-07-15 منبع:decrypt.co

به طور خلاصه

  • Bonsai 27B از PrismML یک مدل هوش مصنوعی ۲۷ میلیارد پارامتری است که به ۳.۹ گیگابایت فشرده شده است – به اندازه کافی کوچک که روی آیفون ۱۷ پرو مکس با سرعت ۱۱ توکن در ثانیه اجرا شود. این اولین بار است که مدلی با این سطح توانایی، محدودیت حافظه یک گوشی هوشمند را رفع می‌کند.
  • نسخه سه حالته، ۹۴.۶٪ از عملکرد بنچمارک مدل با دقت کامل را حفظ می‌کند و از مدل‌های Qwen "۲ بیتی" معمولی که تقریباً دو برابر بزرگتر هستند و در وظایف ریاضی و کدنویسی زیر ۴ بیت با مشکل مواجه می‌شوند، بهتر عمل می‌کند.
  • طبق گزارش CNBC، اپل در حال مذاکرات اولیه با PrismML در مورد فناوری فشرده‌سازی زیربنایی است و این شرکت مدل فشرده شده Gemma را به عنوان پروژه بعدی در دستور کار خود دارد.

مدل‌های هوش مصنوعی حافظه زیادی مصرف می‌کنند. یک مدل هوش مصنوعی ۲۷ میلیارد پارامتری، که طبق استانداردهای صنعتی متوسط ​​محسوب می‌شود، برای اجرا با دقت نصف به تقریباً ۵۴ گیگابایت حافظه نیاز دارد. اکثر لپ‌تاپ‌ها نمی‌توانند این مقدار را در خود جای دهند. حتی برخی از سیستم‌های دسکتاپ نیز قادر به این کار نیستند.

اوایل این هفته، PrismML مدلی را با حجم ۳.۹ گیگابایت منتشر کرد – به اندازه کافی کوچک که روی آیفون جا شود.

پارامترها، تعداد تنظیمات و تغییراتی هستند که یک مدل می‌تواند مدیریت کند. هرچه پارامترها بیشتر باشند، مدل متراکم‌تر و توانمندتر است.

Bonsai 27B اولین مدل کلاس ۲۷B است که محدودیت حافظه یک گوشی هوشمند مصرف‌کننده را پشت سر گذاشته و با سرعت ۱۱ توکن در ثانیه روی آیفون ۱۷ پرو مکس اجرا می‌شود. (توکن‌ها واحدهای اساسی اطلاعاتی هستند که مدل‌های هوش مصنوعی می‌توانند مدیریت و تولید کنند.) نسخه سه حالته، با ۵.۹ گیگابایت، حدود ۲۶ توکن در ثانیه را روی لپ‌تاپ M5 Pro به دست می‌آورد. هر دو تحت مجوز Apache 2.0 رایگان هستند.

روش فشرده‌سازی، که بر اساس مالکیت فکری کلتک ساخته شده است، هر وزن مدل را از ۱۶ بیت دقت ممیز شناور به یک علامت واحد کاهش می‌دهد – در ساختار باینری، +۱ یا -۱، و در ساختار سه حالته، یکی از سه مقدار. هر گروه ۱۲۸ وزنی، یک عامل مقیاس‌گذاری ۱۶ بیتی را به اشتراک می‌گذارد که نسخه باینری را به ۱.۱۲۵ بیت در هر وزن می‌رساند: ۱۴ برابر کوچکتر از نسخه اصلی با دقت کامل. مدل سه حالته یک وضعیت صفر را برای قدرت بیان کمی بیشتر اضافه می‌کند و در ۱.۷۱ بیت قرار می‌گیرد.

به عبارت ساده‌تر، این بدان معناست که یک مدل هوش مصنوعی سه حالته فقط از سه تنظیم برای هر مقدار داخلی استفاده می‌کند – منفی، صفر یا مثبت – در حالی که یک هوش مصنوعی استاندارد می‌تواند از حدود ۶۵۰۰۰ تنظیم انتخاب کند.

PrismML این کار را بدون از دست دادن کیفیت خروجی انجام داد.

آنچه این مدل را از مدل‌های "بیت پایین" معمولی متمایز می‌کند این است که هیچ بخش با دقت بالاتری به عنوان یک دریچه فرار باقی نمی‌ماند: امبدینگ‌ها، مکانیسم توجه و کل هد مدل زبان همگی به صورت سرتاسری فشرده شده‌اند. اکثر ساختارهای کوانتیزه شده، برخی لایه‌های حساس را با دقت کامل حفظ می‌کنند که در نهایت به عنوان یک معاوضه برای کیفیت بهتر، اندازه آنها را افزایش می‌دهد. Bonsai این بازی را انجام نمی‌دهد.

این دومین انتشار بزرگ در این خانواده است. در ماه مارس، PrismML مدل Bonsai 8B، یک مدل ۱.۱۵ گیگابایتی را عرضه کرد که ثابت کرد معماری ۱-بیتی می‌تواند در ۸ میلیارد پارامتر بدون فروپاشی استدلال خود دوام بیاورد. جهش به ۲۷ میلیارد جایی است که stakes تغییر می‌کند – این مقیاس جایی است که استدلال زنجیره فکری پایدار، استفاده قابل اعتماد از ابزار و رفتار عاملی چند مرحله‌ای واقعاً به طور مداوم ظاهر می‌شود – چیزهایی که مدل‌های کوچکتر هنوز در آنها لنگ می‌زنند.

معیارهای ارزیابی (بنچمارک‌ها)

در ۱۵ بنچمارک ارزیابی شده در حالت تفکر بر روی پردازنده‌های گرافیکی NVIDIA H100 – شامل دانش، ریاضیات، کدنویسی و استفاده از ابزار – Ternary Bonsai 27B به طور متوسط ۸۰.۴۹ امتیاز کسب می‌کند، یا ۹۴.۶٪ از مدل با دقت کامل. نسخه ۱-بیتی به ۷۶.۱۱ می‌رسد.

به طور کلی، در بنچمارک‌ها، این مدل‌ها از Gemma 4 یا Qwen 3.6 از نظر پتانسیلی که برای اندازه خود ارائه می‌دهند، بسیار بهتر عمل می‌کنند.

این مدل‌ها با توجه به آنچه ارائه می‌دهند، بسیار خوب عمل می‌کنند، و با توجه به منابع کمی که نیاز دارند، سخت‌افزارهای کوچک (گوشی‌های هوشمند و رایانه‌های شخصی پایین‌رده) را از نظر قابلیت‌ها به سطح دیگری می‌برند. AIME25 و AIME26، که بر اساس آزمون ریاضیات دعوتی آمریکا مدل‌سازی شده‌اند، برای Ternary Bonsai 27B ۹۳.۷٪ در مقابل ۹۵.۳٪ برای Qwen 3.6B بسیار بزرگتر است. Bonsai در کدنویسی ۸۶ امتیاز در مقابل ۸۸ امتیاز Qwen 3.6 و در دانش عمومی ۷۷٪ در مقابل ۸۳٪ برای Qwen 3.6 کسب می‌کند.

این مدل همچنین از یک زیرساخت توجه ترکیبی استفاده می‌کند که تقریباً ۷۵٪ از لایه‌های آن خطی هستند به جای توجه کاملاً کوادراتیک. این معماری چیزی است که پنجره متنی ۲۶۲ هزار توکنی را روی دستگاه عملی می‌کند – چیزی که یک پشته توجه استاندارد آن را بر روی سخت‌افزار گوشی به شدت گران تمام می‌کند.

ما آن را آزمایش کردیم

ما خودمان Bonsai 27B را اجرا کردیم. کدنویسی نیاز به تکرار دارد: پرامپت‌های تک‌شات با مدل‌های ابری پیشرفته رقابت نمی‌کنند. محلی و رایگان بودن این موضوع را بی‌اهمیت می‌کند. برای بازی Zombie Type ما – یک بازی مرورگر ترسناک تایپی اول شخص – دو دور کدنویسی ویژوال (vibe coding) تشخیص برخورد تمیز، منطق امتیازدهی مناسب و گرافیک یکپارچه را تولید کرد. مدل ساختار را زود درک می‌کند؛ مرحله دوم به جای بازسازی، آن را اصلاح می‌کند.

جالب اینجاست که برخی از مدل‌ها (مانند اسکلت‌ها) پیچیده‌تر از مدل‌های GPT 5.6 Sol به نظر می‌رسیدند. این به هیچ وجه به معنای بهتر بودن نیست، فقط در این وظیفه یک اسکلت زیبا تولید کرد، در حالی که پادشاه هوش مصنوعی انتخاب سبکی ضعیف‌تری داشت.

بازی برای آزمایش در اینجا در دسترس است.

نوشتن خلاقانه داستانی پیچیده‌تر است و معیارهای آن ذهنی‌تر هستند.

به طور کلی، اگر پرامپت یک‌بار مصرفی در ذهن داشته باشید، نتایج به طور خاص تخیلی نیستند.

با این حال، Bonsai داستان‌هایی با منطق داخلی، ریتم و قوس ثابت تولید می‌کند – بهتر، یا هم‌تراز با Claude Haiku یا حتی Sonnet با تلاش کمتر در پرامپت‌های مشابه. برای مدلی که کاملاً روی سخت‌افزار خودتان و بدون هزینه‌های API اجرا می‌شود، این حرف زیادی است.

داستانی که این مدل ایجاد کرده است را می‌توانید در مخزن گیت‌هاب ما پیدا کنید.

PrismML همچنین یک لایه رمزگشایی گمانه‌زن DSpark را در کنار مدل ارائه می‌دهد – یک پیش‌نویس‌ساز سبک‌وزن که بلوک‌هایی از توکن‌های نامزد را پیشنهاد می‌کند، که مدل اصلی آنها را در یک گذر پیشرو واحد تأیید می‌کند نه اینکه توکن به توکن تولید کند. روی H100 این امر ۱.۳۷ برابر افزایش توان عملیاتی را بدون تغییر در کیفیت خروجی به ارمغان می‌آورد، زیرا تأیید توزیع دقیق خروجی را حفظ می‌کند. روی Apple Silicon هنوز به طور پیش‌فرض فعال نیست، اما برای سرویس‌دهی GPU یک دستاورد واقعی است.

علاقه اپل بُعد تجاری به این موضوع اضافه می‌کند. بابک حسیبی، مدیرعامل PrismML، به CNBC تأیید کرد که این شرکت در حال مذاکرات اولیه با اپل است، که در حال ارزیابی فناوری فشرده‌سازی برای استفاده احتمالی روی دستگاه است.

حسیبی گفت که مدل فشرده شده Gemma پروژه بعدی در دستور کار است، و سپس مدل‌های پیشرفته‌تر و بزرگتر. Bonsai 27B 1-بیتی اکنون به صورت رایگان تحت مجوز Apache 2.0 قابل دانلود است. اگر به راهنمایی برای اجرای مدل‌هایی مانند این به صورت محلی نیاز دارید، راهنمای ما را بررسی کنید.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!