نایبرئیس استارتاپها و اکوسیستم جهانی سرمایهگذاران گوگل توضیح میدهد:
چرا استارتاپ شما در کنار APIهای مدلهای هوش مصنوعی پیشرو به مدلهای متنباز هم نیاز دارد؟
استارتاپها با سرعت بیسابقهای محصولات خود را توسعه میدهند و از مرحله شکلگیری ایده به تناسب محصول با بازار میرسند. در این مسیر، مدلهای پایه به بخش جداییناپذیر جریانهای کاری محصولات تبدیل شدهاند.
اما «دارن مووری» (Darren Mowry)، نایبرئیس استارتاپها و اکوسیستم جهانی سرمایهگذاران گوگل استارتاپها معتقد است بااینحال، تفاوت میان استارتاپهایی که با مشکل حاشیه سود مواجهاند و کسبوکارهایی که بهصورت پایدار رشد میکنند، بیشازپیش به انتخاب معماری هوش مصنوعی وابسته است.

معماری ترکیبی هوش مصنوعی؛ راهکاری برای کاهش هزینه و افزایش سرعت
مووری مینویسد در سالهای نخست ظهور مدلهای زبانی بزرگ (LLM)، رویکرد متداول این بود که تمام درخواستها به بزرگترین مدل موجود ارسال شوند. اما با ورود برنامهها به محیط عملیاتی، افزایش تعداد کاربران به میلیونها نفر و گسترش گردشکارهای خودکار چندعاملی، اتکا به یک مدل پیشرو (Frontier Model) محدودیتهایی ایجاد میکند. محدودیتهایی از جمله:
- نخست، رفتوبرگشت مداوم درخواستها به فضای ابری، دستیابی به پاسخگویی زیر یک ثانیه را در برنامههای تعاملی موبایل و دسکتاپ دشوار میکند.
- دوم، میزبانی مدلهای باز بزرگ با بیش از ۷۰ میلیارد پارامتر، تیمهای کوچک را ناچار میکند منابع مهندسی ارشد خود را به تأمین و پیکربندی خوشههای پردازشی و هماهنگسازی چند GPU اختصاص دهند.
- سوم، ارسال وظایف پرتکرار و ساختاریافته، مانند تشخیص قصد کاربر، استخراج JSON و اعتبارسنجی وضعیت، به APIهای گرانقیمت مدلهای عمومی، سرمایهای را مصرف میکند که میتوانست صرف توسعه قابلیتهای متمایزکننده محصول شود.
راهکار پیشنهادی، استفاده از یک معماری ترکیبی هوش مصنوعی است؛ معماریای که در آن مدلهای پیشرو برای ترکیب و تحلیل پیچیده اطلاعات به کار میروند و مدلهای کوچکتر با وزنهای باز برای وظایف مشخص، پرتکرار و قابلکنترل استفاده میشوند. برایناساس، مووری و گوگل معتقدند مدلهای خانواده Gemma باید در کنار مدلهای Gemini در سبد مدلهای استارتاپها قرار گیرند. به ادعای وی مدلهای Gemma تاکنون بیش از یک میلیارد بار از سوی جامعه توسعهدهندگان دانلود شدهاند و Gemma 4 توانمندترین خانواده مدلهای باز گوگل تاکنون است.
شتابدهی به Gemma 4: استنتاج سریعتر با پیشنویسهای پیشبینی چندتوکنی

Gemma 4؛ خانوادهای از مدلهای باز با معماریهای متنوع
گوگلDeepMind مدل متنباز Gemma با استفاده از پژوهشهای بنیادی و پیشرفتهای معماری مشترک با مدلهای Gemini توسعه داده است. این اشتراک در فناوری و ابزارهای توسعه به تیمها اجازه میدهد نمونههای اولیه خود را در Google AI Studio بسازند و معماریهایی طراحی کنند که در آنها Gemini و Gemma در کنار یکدیگر فعالیت میکنند.
Gemma 4 تحت مجوز Apache 2.0 منتشر شده است؛ مجوزی که امکان استفاده تجاری را فراهم میکند. این خانواده با تمرکز بر بهرهوری پارامترها و توکنها، پنج اندازه مدل را در چهار معماری تخصصی پوشش میدهد:
- E2B و E4B: مدلهای فشرده با قابلیتهای بومی صوتی و بینایی برای دستگاههای موبایل و سامانههای لبهای.
- مدل چندوجهی 12B Unified: معماری چندوجهی بدون رمزگذار.
- مدل 26B A4B از نوع ترکیب متخصصان (MoE): مدلی که در هر توکن فقط چهار میلیارد پارامتر را فعال میکند و برای پردازش پرترافیک طراحی شده است.
- مدل متراکم 31B: مدلی مناسب برای دستیابی به کیفیت استدلال بالا و تنظیم دقیق که روی یک GPU جا میگیرد.
تمام مدلها از حالتهای قابلتنظیم تفکر، فراخوانی بومی توابع (Function Calling)، پنجره زمینه تا ۲۵۶ هزار توکن و مدلهای پیشنویس پیشبینی چندتوکنی (MTP) برای رمزگشایی حدسی پشتیبانی میکنند.

تجربه استارتاپها از بهکارگیری Gemma
نمونههای عنوان شده توسط مووری نشان میدهند که استارتاپها از Gemma برای کاهش هزینه، افزایش دقت خروجی و بهبود سرعت پاسخگویی استفاده میکنند.
Cue؛ کاهش ۴۴ درصدی تأخیر
Cue یک دستیار دسکتاپ صوتی است که وظایف روزمره را مستقیماً روی رایانه کاربر خودکار میکند. این شرکت مدل Gemma 4 E4B را از طریق ابزار Ollama روی سختافزار محلی به کار گرفت تا قالببندی متن پیادهسازیشده از گفتار را در زمان واقعی انجام دهد. برخلاف انتظار اولیه که Gemma صرفاً جایگزینی ضعیف برای حالت آفلاین باشد، آزمونها نشان دادند این مدل آنقدر سریع و دقیق است که به موتور پیشفرض محصول تبدیل شد. در نتیجه، تأخیر از ۸۷۶ به ۴۸۸ میلیثانیه کاهش یافت؛ یعنی افتی معادل ۴۴ درصد.
HubX و BetterSpeak؛ آموزش زبان بدون هزینه سرور
استودیوی توسعه موبایل HubX محصول BetterSpeak را ساخته است؛ معلمی تعاملی برای یادگیری زبان انگلیسی که مکالمات صوتی بلادرنگ را شبیهسازی میکند. برای دورزدن تأخیر شبکه تلفن همراه و جلوگیری از تحمیل هزینه اشتراک بالا به کاربران، این شرکت نسخه چهاربیتی Gemma 4 E2B را با حجمی حدود ۲٫۹ گیگابایت مستقیماً روی دستگاه اجرا کرد. نتیجه، یک معلم آفلاین در موبایل با قابلیت تبدیل گفتار به گفتار بود که هزینه سرور آن برای شرکت صفر است.
K-Dense؛ کشف علمی در محیطهای ایزوله
شرکت K-Dense محصول Faraday را بهعنوان همکار علمی مبتنی بر هوش مصنوعی توسعه داده است. این سامانه با ترکیب Gemma 4 و مهارتهای عامل علمی اختصاصی K-Dense، سختافزار، نرمافزار و مجموعه حسگرها را در یک راهکار یکپارچه به کار میگیرد. Faraday بهصورت کاملاً ایزوله از شبکه اجرا میشود و برای فعالیتهای علمی محرمانه در صنایع داروسازی و زیستفناوری مناسب است. همچنین، اجرای Gemma 4 روی NVIDIA DGX Spark امکان فاینتیون کردن مدل با مجموعهدادههای اختصاصی کاربران بهصورت لوکال را فراهم میکند.
Latitude؛ افزایش ماندگاری بازیکنان
شرکت بازیسازی Latitude مدل Gemma را در محصولات بازی مبتنی بر هوش مصنوعی خود ادغام کرده است و جایگزینی مدل در بازی AI Dungeon به بهبود چشمگیر ماندگاری بازیکنان انجامید. پلتفرم نقشآفرینی (AI RPG) هوش مصنوعی Voyage نیز از Gemma برای ارائه هوش سطح بالا با هزینهای استفاده میکند که امکان بازی نامحدود و پاسخگویی بسیار سریع را فراهم میسازد.

چهار کاربرد کلیدی Gemma برای استارتاپها
اجرای محلی و پردازش لبهای
در برنامههای موبایل، ابزارهای توسعه دسکتاپ، رباتیک و محصولات مبتنی بر عملکرد آفلاین، هر رفتوبرگشت به فضای ابری به تأخیر میافزاید. Gemma میتواند مستقیماً روی لپتاپها، از جمله دستگاههای مجهز به تراشههای اپل، تلفنهای هوشمند و تجهیزات لوکال اجرا شود. در این حالت، پاسخگویی سریعتر است و دادههای حساس نیازی به خروج از دستگاه ندارند. بسیاری از تعاملات لوکال را میتوان بدون هزینه افزایشی اجرا کرد و برای درخواستهای پیچیدهتر، اتصال به مدلهای پیشرو ابری را حفظ کرد. وظایفی مانند استدلال چندوجهی گسترده، ترکیب اطلاعات در زمینههای طولانی و برنامهریزی پیچیده میتوانند به Gemini ارجاع داده شوند.
غربالگری ترافیک و مسیریابی عاملها
در معماریهای چندعاملی، بخش قابلتوجهی از توکنها صرف وظایف سادهای مانند بررسی وضعیت، طبقهبندی وظایف و مسیریابی درخواستها میشود. استفاده از Gemma بهعنوان دروازه ورود میتواند این وظایف پرتکرار را به مدلی کوچکتر بسپارد و منابع مدلهای پیشرو را برای درخواستهایی حفظ کند که ارزش بیشتری برای محصول ایجاد میکنند.
فاینتیونینگ اختصاصی برای ایجاد مزیت رقابتی
فاینتیونینگ یا سازگارکردن مدل با دادههای اختصاصی یکی از راههای ایجاد مزیت رقابتی پایدار است. دسترسی به وزنهای مدل Gemma و نیاز حافظهای محدود آن، امکان تنظیم دقیق و فاینتیونینگ کارآمد از نظر پارامترها، با روشهایی مانند LoRA و QLoRA را فراهم میکند. گوگل مدعیست این فرایند را میتوان بهجای چند روز، طی چند ساعت روی یک GPU انجام داد.
شروع سریع در حوزههای تخصصی
مدلهای تخصصی خانواده Gemma میتوانند نیاز به توسعه از صفر را کاهش دهند. برای نمونه، MedGemma در آزمون MedQA امتیاز ۸۷٫۷ درصد کسب کرده است؛ رقمی که با دقت بالینی مدلهای پیشرو با هزینه استنتاج تقریباً یکدهم، برابری میکند. در یک مطالعه بالینی دوسوکور، رادیولوژیستهای دارای بورد تخصصی، ۸۱ درصد گزارشهای رادیوگرافی قفسه سینه تولیدشده با نسخه سبک MedGemma 1.5 4B را از نظر تأثیر بر مدیریت بیمار، معادل گزارشهای متخصصان انسانی ارزیابی کردند.
در حوزه زیستفناوری نیز استارتاپها از C2S Scale برای مدلسازی پاسخهای مجازی سلولها و تسریع پژوهشهای سرطان استفاده میکنند. مدل DataGemma هم با ارجاع متقابل به بیش از ۲۴۰ میلیارد نقطه داده عمومی، به کاهش توهمهای عددی کمک میکند. استفاده از مدلی که از ابتدا با زبان و نیازهای یک صنعت تخصصی سازگار است، میتواند زمان مهندسی و بودجه محاسباتی را کاهش دهد.

استقرار بدون وابستگی به یک زیرساخت خاص
گوگل برای ادغام Gemma در زیرساختهای موجود، چند مسیر ارائه میکند:
- مجوز Apache 2.0: امکان تنظیم دقیق، کمّیسازی (quantize)، توزیع مجدد و استقرار تجاری در محیطهای لوکال یا لبهای، همراه با مالکیت وزنهای سفارشی.
- پشتیبانی از ابزارهای توسعه: سازگاری با ابزارهایی مانند vLLM، Ollama، llama.cpp، LM Studio، MLX، Unsloth، Hugging Face، Kaggle، Keras، PyTorch، JAX و LiteRT-LM.
- استقرار ابری مدیریتشده: نمونهسازی یا همان ساخت پروتوتایپ در Google AI Studio، استفاده از GPUهای بدون سرور در Cloud Run و استقرار نقاط پایانی اختصاصی از طریق Model Garden در Gemini Enterprise Agent Platform.
- ایمنی سازمانی: ارزیابیهای ایمنی پیش از انتشار، پالایش داده و آزمونهای ردتیمینگ، همراه با ShieldGemma 2 برای کمک به رعایت الزامات سازمانی.
سه اقدام پیشنهادی برای تیمهای مهندسی
مووری سه اقدام عملی برای استارتاپها پیشنهاد میدهد:
- ممیزی فراخوانیهای مدل: داشبورد ثبت رویدادها را بررسی کنید و سه وظیفه پرتکرار و نسبتاً قطعی، مانند طبقهبندی وظایف، اعتبارسنجی JSON یا خلاصهسازی را که با گرانترین مدلها اجرا میشوند، شناسایی کنید.
- ارزیابی Gemma: یک مدل فشرده Gemma را بهصورت لوکال یا روی یک نقطه پایانی اجرا کنید. تأخیر را اندازه بگیرید و تأثیر کاهش هزینه استنتاج بر حاشیه سود ناخالص را محاسبه کنید.
- سرمایهگذاری مجدد منابع: سرمایه و زمان مهندسی صرفهجوییشده را به قابلیتهایی اختصاص دهید که محصول را از رقبا متمایز میکنند.
مووری در نهایت جمعبندی میکند که معماری مناسب هوش مصنوعی به انتخاب یک مدل برای انجام همه وظایف وابسته نیست؛ بلکه باید برای هر وظیفه، ابزار متناسب انتخاب شود تا توسعه سریعتر، منابع مالی پایدارتر و کیفیت محصول بهتر شود.
