سارا ملکی مهر ۳۰, ۱۴۰۴
اوراکل با Zettascale10 به ۱۶ زتافلاپس می‌رسد

اوراکل ادعا کرده است که بزرگترین ابرکامپیوتر هوش مصنوعی در فضای ابری را با نام OCI Zettascale10 معرفی کرده است. این شرکت بیان می‌دارد که این سیستم می‌تواند به اوج کارکرد ۱۶ زتافلاپس برسد و از نزدیک به ۸۰۰ هزار پردازنده گرافیکی انویدیا در مراکز داده گوناگون بهره‌برداری می‌کند. این توان خروجی در صورت تقسیم معادل، نزدیک به ۲۰ پتافلاپس برای هر پردازنده گرافیکی است که تقریباً با تراشه Grace Blackwell GB300 Ultra هم‌سو است.

پایه زیرساختی خوشه Stargate در تگزاس

به گزارش بخش صنایع زیرساختی رسانه تکنولوژی تکنا، این پلتفرم به عنوان زیرساخت بنیادین برای خوشه Stargate شرکت OpenAI در شهر ابیلین، تگزاس عمل می‌کند. این مجموعه برای مدیریت سنگین‌ترین بارهای کاری هوش مصنوعی نوظهور در حوزه‌های تحقیقاتی و تجاری طراحی شده است. پیتر هوشله از OpenAI اشاره کرد که طراحی سفارشی و بالا‌مقیاس‌پذیر RoCE کارکرد سراسری پارچه (Fabric) را در مقیاس گیگاواتی به حداکثر می‌رساند، در حالی که بیشتر توان را بر روی محاسبات متمرکز نگه می‌دارد.

معماری شبکه Oracle Acceleron RoCE

در هسته سیستم Zettascale10، شبکه Oracle Acceleron RoCE قرار دارد که برای افزایش مقیاس‌پذیری و قابلیت اطمینان در عملیات‌های سنگین هوش مصنوعی طراحی شده است. این معماری از کارت‌های رابط شبکه به عنوان سوئیچ‌های کوچک بهره می‌برد. این کارت‌ها پردازنده‌های گرافیکی را در چندین صفحه شبکه ایزوله به یکدیگر متصل می‌کنند. هدف اصلی این طراحی، کاهش تاخیر بین پردازنده‌های گرافیکی است.

استحکام در برابر خرابی

این ساختار به‌گونه‌ای طراحی شده که در صورت خرابی یک مسیر شبکه، کارها بدون وقفه به اجرا ادامه یابند. ایان باک از انویدیا بیان کرد که OCI Zettascale10 با بهره‌گیری از زیرساخت کامل هوش مصنوعی انویدیا، پارچه محاسباتی مورد نیاز را برای پیشبرد تحقیقات پیشرفته هوش مصنوعی فراهم می‌کند. این سیستم سازمان‌ها را در سراسر جهان در حرکت از مرحله آزمایش به سمت هوش مصنوعی صنعتی‌شده پشتیبانی می‌کند.

[elementor-template id="2142"]

بهینه‌سازی هزینه و انرژی

اوراکل ادعا می‌کند این معماری می‌تواند با ساده‌سازی لایه‌های شبکه، هزینه‌ها را کاهش دهد و همزمان کارکرد ثابتی را در همه گره‌ها حفظ کند. این سیستم از فناوری‌های نوری خطی قابل اتصال و گیرنده (Pluggable Optics) بهره می‌برد تا مصرف انرژی و نیاز به خنک‌کننده را بدون افت پهنای باند کاهش دهد.

نکات انتقادی و چالش‌ها

اگرچه ارقام اعلام‌شده توسط اوراکل قابل توجه هستند، اما این شرکت هیچ تأییدیه مستقیمی برای ادعای ۱۶ زتافلاپس خود ارائه نکرده است. معیارهای کارکرد ابری بسته به نحوه محاسبه توان عملیاتی می‌تواند متفاوت باشد. امکان دارد قیاس اوراکل بر پایه نرخ‌های اوج نظری به جای نرخ‌های پایدار استوار باشد.

با توجه به اینکه مجموع تبلیغ شده سیستم معادل ۸۰۰ هزار پردازنده گرافیکی پیشرفته است، بازدهی در دنیای واقعی می‌تواند به شدت به طراحی شبکه و بهینه‌سازی نرم‌افزار وابسته باشد. تحلیلگران منتظر خواهند ماند تا ببینند آیا این پیکربندی، عملکردی قابل مقایسه با خوشه‌های هوش مصنوعی پیشرو که قبلاً توسط دیگر ارایه‌دهندگان بزرگ ابری اجرا شده‌اند، ارائه می‌دهد یا خیر.

موقعیت رقابتی و حاکمیت داده

سیستم Zettascale10 اوراکل را در کنار دیگر بازیگران مهم قرار می‌دهد که برای ارایه زیرساخت‌های پشتیبان بهترین پردازنده‌های گرافیکی و ابزارهای هوش مصنوعی رقابت می‌کنند. اوراکل می‌گوید مشتریان می‌توانند مدل‌های بزرگ را در محیط ابری توزیع‌شده اوراکل آموزش داده و مستقر کنند، به‌گونه‌ای که توسط تدابیر حاکمیت داده حمایت شود.

انعطاف‌پذیری عملیاتی

اوراکل بیان می‌دارد Zettascale10 از طریق نگهداری جداگانه در سطح صفحه (Rack-level Isolation)، انعطاف‌پذیری عملیاتی ارائه می‌دهد که امکان به‌روزرسانی با کمترین زمان توقف را فراهم می‌کند. ماهش تیاگاراجان از اوراکل گفت که این شرکت معماری شبکه Oracle Acceleron RoCE خود را با زیرساخت هوش مصنوعی نسل بعدی انویدیا ترکیب می‌کند تا ظرفیت هوش مصنوعی چند گیگاواتی را در مقیاسی بی‌نظیر ارایه دهد.

به گفته او، مشتریان می‌توانند بزرگترین مدل‌های هوش مصنوعی خود را با هزینه کمتر بسازند، آموزش دهند و مستقر کنند. آن‌ها این آزادی عمل را در سراسر ابر توزیع‌شده اوراکل با حاکمیت قوی داده و هوش مصنوعی خواهند داشت. با این حال، ناظران اشاره می‌کنند که دیگر ارایه‌دهندگان نیز در حال ساخت خوشه‌های پردازنده گرافیکی مقیاس بزرگ و سیستم‌های ذخیره‌سازی ابری پیشرفته خود هستند که می‌تواند برتری اوراکل را کاهش دهد.

افق زمان‌بندی و نتیجه‌گیری

این سیستم در سال آینده ارایه خواهد شد و تنها در آن زمان آشکار خواهد شد که آیا این معماری می‌تواند تقاضا برای محاسبات هوش مصنوعی مقیاس‌پذیر، کارآمد و قابل اطمینان را برآورده کند یا خیر.