أكسب عمولة إذا سجلت أو اشتريت من روابط الأفلييت في هذي الصفحة، بدون أي تكلفة إضافية عليك.
هوم لاب · شرح · بقلم محمد المهنا · آخر تحديث
نماذج LLM المحلية ضد GPU سحابي: متى تستأجر بدل ما تشتري
أنا أشغل نماذج محلية على RTX 3080 بذاكرة 10 GB داخل جهاز الـ Proxmox حقي، Ollama مع Open WebUI، وغالبا نموذج Qwen. النموذج المحلي على عتاد استهلاكي ولا يقرب من GPT-5 أو Claude في الشغل الحقيقي. أنا مبقيه للمهام الصغيرة السريعة، وللخصوصية، ولأني أقدر أضغط عليه طول اليوم ببلاش. الجدار اللي تصطدم فيه هو الـ VRAM. أول ما يصير النموذج أكبر من كرتك، يا تشتري GPU أكبر بالكاد بتستخدمه، يا تستأجر واحد بالساعة. هذي طريقتي في القرار.
الجدار دايم هو الـ VRAM
النموذج لازم أوزانه تركب في ذاكرة الـ GPU عشان يشتغل بأي سرعة حقيقية. إذا ما ركب في الـ VRAM، يفيض على رام النظام ويزحف، أو أصلا ما يحمل. فانس كم سرعة كرتك. السؤال الوحيد اللي يهم هو هل النموذج يركب. أغلب الناس يشغلون النماذج بضغط 4-bit، وهو كافي لكل شي تقريبا، وعلى هالحجم الأرقام التقريبية:
| حجم النموذج (4-bit) | الـ VRAM المطلوب | يشتغل مرتاح على |
|---|---|---|
| 7B إلى 8B | ~5 إلى 6 GB | تقريبا أي GPU حديث، ومنهم الـ 3080 حقي أبو 10 GB |
| 13B إلى 14B | ~9 إلى 10 GB | كرت 12 GB، وضيقة على 10 GB |
| 30B إلى 34B | ~20 إلى 22 GB | كرت 24 GB (RTX 3090, 4090) |
| 70B | ~40 إلى 48 GB | كرت احترافي 48 GB، أو GPU سحابي |
| 100B وفوق | 80 إلى +200 GB | GPU سحابي (H100, H200, MI300X) |
الـ 3080 حقي يشغل نماذج 7B و 8B بسهولة، و 13B إذا خليت السياق قصير. بعدها ينهار بسرعة. نموذج 70B ما يشتغل على VRAM استهلاكي بدون offloading بطيء، والنماذج المفتوحة الكبيرة أبعد من كذا بكثير. gpt-oss-120b في البيت على 10 GB؟ لا. ولا على 4090 بعد. فأول ما تبغى شي أكبر مما يشيله كرتك، عندك قرار تاخذه.
متى تخليه محلي
للمهام الصغيرة السريعة، المحلي يفوز. نموذج 7B إلى 14B على كرت أنت أصلا مالكه يتكفل بإعادة صياغة سريعة أو تلخيص سريع أو سؤال عابر طول اليوم بدون ما تفكر فيه. الكهرباء رخيصة، هللات بالساعة وأقل حتى في مكاني (بالإنجليزي)، وما فيه عداد يعد، وبرومبتاتك عمرها ما تطلع من شبكتك. فخله محلي لما تكون المهمة صغيرة، أو البيانات حساسة، أو تبغى تستخدمه قد ما تبغى ببلاش. هذا السبب الحقيقي اللي مشغل لي واحد. بس لا تتوقع إنه يعوض نموذج frontier في أي شي جدي، لأنه ما راح.
متى تستأجر GPU سحابي بدالها
بعض أهل الـ self-hosting يعتبرون أي استخدام للسحابة تهرب. اطنشهم. لما عتادك ما يقدر على الشغلة، استئجار GPU لكم ساعة هو القرار الصح. استأجر للشغل اللي كرتك ما يقدر عليه واللي ما تسويه بما يكفي لتبرير شراء عتاد له. وين تستاهل:
- تشغيل نموذج ما يركب. تبغى تجرب 70B أو نموذج بحجم frontier ذاكرتك ما تشيله. شغل GPU بذاكرة 80 GB أو 141 GB، شغله، وطفه.
- الـ fine-tuning أو التدريب. التدريب يحتاج ذاكرة أكثر بكثير من الاستدلال، وعادة تسويه على دفعات، مو باستمرار. استئجار GPU كبير لكم ساعة يغلب امتلاك واحد قاعد خامل.
- مهام الدفعات. عندك كومة مستندات لمرة واحدة تبغى تعالجها أو embeddings تولدها. استأجر GPU كبير، شغل الدفعة، واحذفه.
- جرب قبل ما تشتري. قبل ما تصرف فلوس حقيقية على كرت أكبر، استأجر GPU سحابي لسهرة، شغل النماذج الأكبر اللي عينك عليها، واكتشف هل الترقية فعلا تستاهل عندك.
استأجر بالساعة واحذفه لما تخلص. الـ H100 يطلع عليك حوالي 8 إلى 12 ريال بالساعة (يفوتر بالدولار، بالثانية)، فجلسة تدريب أربع ساعات تكلف كم عشر ريال بدل آلاف الريالات. GPU Droplets من DigitalOcean تنفع لهذا. اختر GPU، شغله، خلص الشغلة، احذفه، والعداد يوقف. تدفع مقابل الشغل، مو مقابل كرت قاعد في كيس.
طريقتان يضيع فيهما الناس فلوسهم
طريقتان يضيع فيهما الناس فلوسهم هنا، وهما غلطتان متعاكستان.
الفخ الأول، شراء كرت كبير لاستخدام متقطع. إذا بتشغل نموذج 70B مرتين بالشهر، لا ترمي آلاف الريالات على GPU بذاكرة 48 GB عشانه. بكم عشر ريال بالساعة تقدر تستأجر نفس الشي مرتين بالشهر لسنوات وتظل صارف أقل، وبدون شي قاعد في دولاب يخسر قيمته. أنا ضيعت فلوس حقيقية على عتاد ما سوى اللي افترضته، فآخذ هالنقطة بجدية.
الفخ الثاني، تشغيل خدمة 24/7 على GPU مستأجر. GPU سحابي متروك شغال على مدار الساعة غالي بشكل وحشي، بسهولة من 4,000 إلى 7,500 ريال بالشهر. إذا تبغى مساعد شغال دايم، هذي وظيفة كرتك أنت. استأجر للدفعات، واملك للحمل الثابت. اعكسهم والفاتورة بشعة بالحالتين.
كيف أسويها أنا
سواقي اليومي هو الستاك المحلي. نماذج صغيرة ومتوسطة على الـ 3080 عبر Ollama و Open WebUI، شغالة دايم، خاصة، وشبه ببلاش، للأشياء الصغيرة. ولما شي ما يركب، نموذج أبغى أختبره أو دفعة تحتاج ذاكرة حقيقية، أشغل GPU droplet، أخلص الشغل، وأقتله بنفس الساعة، وما يظل شي غالي قاعد بعدها. الهوم لاب يغطي الأوقات اللي أحتاج فيها جواب سريع الحين. والسحابة تغطي الأوقات النادرة اللي أحتاج فيها نموذج أكبر لفترة. هم مو متنافسين على نفس الوظيفة.
أسئلة شائعة
كم VRAM أحتاج لتشغيل LLM محلي؟
لنموذج مضغوط 4-bit، احسب تقريبا 5 إلى 6 GB لنموذج 7B إلى 8B، و 9 إلى 10 GB لـ 13B، وحوالي 20 GB لـ 30B. نموذج 70B يحتاج 40 GB أو أكثر، وهذا بعد الكروت الاستهلاكية. طول السياق يزيد فوقها، فخل لك هامش.
أيهما أرخص، تشغيل AI محلي أو في السحابة؟
للنماذج اللي تركب على كرتك وتستخدمها باستمرار، المحلي أرخص بفارق كبير. العتاد تكلفة مدفوعة أصلا والكهرباء هللات بالساعة. وللنماذج الكبيرة اللي تحتاجها أحيانا بس، الاستئجار بالساعة يغلب شراء كرت بيقعد خامل. المسألة كلها كم مرة فعلا تحتاج الـ GPU الأكبر.
أقدر أشغل نموذج 70B على GPU استهلاكي؟
مو براحة. نموذج 70B بضغط 4-bit يحتاج حوالي 40 إلى 48 GB من الـ VRAM، أبعد بكثير من 4090 أبو 24 GB. تقدر تفرغ طبقات على رام النظام، بس يبطأ بسرعة. لـ 70B وأكبر، GPU سحابي مستأجر بذاكرة 80 GB أو أكثر هو الطريق العملي.
وش فايدة GPU سحابي إذا عندي أصلا هوم لاب؟
المهام اللي كرتك ما يقدر عليها واللي ما تسويها كثير: تشغيل نموذج أكبر من الـ VRAM حقك، والـ fine-tuning أو التدريب على دفعات، وشغل الدفعات لمرة واحدة. تستأجر الـ GPU بالساعة، تخلص الشغلة، وتطفيه، بدل ما تشتري عتاد غالي لاستخدام متقطع.