أكسب عمولة إذا سجلت أو اشتريت من روابط الأفلييت في هذي الصفحة، بدون أي تكلفة إضافية عليك.
هوم لاب · شرح · بقلم محمد المهنا · آخر تحديث
بديل ChatGPT مستضاف ذاتيا: Ollama و Open WebUI
كرت شاشة بذاكرة 10 GB يشغل النماذج في نطاق 7 إلى 14 مليار باراميتر، عوائل Llama و Qwen و Gemma و Phi، وولا واحد منها يقرب من GPT-5 أو Claude في الشغل الصعب. هذا هو السقف، وأغلب الصفحات في هالموضوع تتجاهله. اللي تنفع فيه النماذج المحلية هو المهام الصغيرة السريعة، والخصوصية الكاملة، وتشغيلها قد ما تبغى ببلاش. أنا أشغل مساعد خاص على طريقة ChatGPT في البيت بـ Ollama و Open WebUI على RTX 3080، وولا شي أكتبه يطلع من البيت. وبعد أدفع لـ API. المحلي يتكفل بالسريع والخاص، والـ API يتكفل بالمشاكل الصعبة. هالصفحة عن وين يقعد هالخط، ومتى اشتراك الـ 75 ريال بالشهر (20 دولار) هو ببساطة الشراء الأفضل.
وين يقعد السقف
شغل Ollama مع Open WebUI إذا تبغى مساعد خاص للمهام الصغيرة السريعة وعندك GPU بذاكرة 8 GB على الأقل، أو عندك الصبر تشغل نماذج صغيرة على CPU. يتكفل بالأسئلة السريعة وإعادة الصياغة السريعة والتلخيصات القصيرة والنصوص العابرة، كله على عتاد أنت مالكه. السقف هو الشي اللي لازم تكون واضح مع نفسك فيه. النموذج المحلي على عتاد استهلاكي ما يجاري GPT-5 أو Claude في أي شي متطلب، فما راح يعوض اشتراك frontier للشغل الصعب. عشان كذا أنا أشغل الاثنين. المحلي للسريع الخاص، و API مدفوع للمشاكل الحقيقية، وهذا يغلب إنك تجبر نفسك تختار واحد.
وش يشتري لك اشتراك ChatGPT فعليا
اشتراك ChatGPT Plus يشتري لك الـ frontier. الإجابات أفضل شي تقدر تحصله، ويتصفح الويب، ويشغل أدوات، ويسوي صور، والتطبيقات نظيفة على كل جهاز. يكلف 75 ريال بالشهر (20 دولار). كل برومبت ترسله يطلع من جهازك ويهبط على سيرفرات OpenAI، ولناس كثير هالجزئية الأخيرة هي العقدة، سواء للخصوصية أو لشغل سري أو من باب المبدأ. الإعداد المحلي لازم يكون كافي لمهامك الحقيقية، وبالمقابل كل شي يظل على عتادك أنت.
Ollama أو LM Studio أو خليط بينهما
Ollama و Open WebUI
Ollama هو المحرك اللي ينزل النماذج المفتوحة ويشغلها محليا بأمر واحد. و Open WebUI هي الواجهة اللي تحوله لمحادثة نظيفة شبيهة بـ ChatGPT في متصفحك، مع محادثات وبرومبتات نظام وعدة نماذج. أنا أشغل الاثنين في Docker على جهاز الـ Proxmox حقي، على الـ VM اللي فيها الـ RTX 3080 معدى لها، وكرت 10 GB مثله يشغل مرتاح نماذج 7 إلى 14 مليار باراميتر. هذا يغطي عوائل Llama و Qwen و Gemma و Phi، وهي الحجم الصح للشغل المحلي السريع. والسقف باقي مكانه. حتى أفضل نموذج يركب على كرت بهالحجم بعيد كل البعد عن نموذج frontier، والجودة تكبر مع كمية ذاكرة الفيديو اللي عندك، وأنت اللي تسحب النماذج الجديدة وتحدث الستاك. ولا شي منها صعب. هو بس شغلك أنت.
LM Studio
إذا بس تبغى AI محلي على سطح مكتبك وما يهمك تقدمه لأجهزة ثانية، LM Studio يجمع مشغل النماذج وواجهة المحادثة في تنزيل واحد. هو أسهل مدخل. هو برنامج محلي مو خدمة مستضافة ذاتيا، فروح له لما جهاز واحد هو كل اللي تحتاجه.
Open WebUI مع مفتاح API مدفوع
هذا اللي أنا فعليا أسويه. شغل Open WebUI للواجهة الخاصة، ووجهها على API مدفوع من OpenAI أو Anthropic للأسئلة الصعبة، ووجهها على Ollama المحلي حقك للأسئلة السريعة. تتنازل عن الاستقلالية الكاملة، بس تحصل جودة frontier عند الطلب داخل واجهة أنت متحكم فيها. لأغلب الناس هذا هو الجواب الصح. المحلي يتكفل بالمهام الصغيرة ببلاش، والـ API موجود لما يصعب الشغل.
تقريب الفرق بالإضافات
المحادثة العادية مو كل اللي تحصله. Open WebUI يتوصل بقطع مستضافة ذاتيا ثانية تسد جزء من الفرق مع ChatGPT، وولا شي يطلع من شبكتك. اقرنه بـ SearXNG، محرك بحث مستضاف ذاتيا، ومساعدك المحلي يسحب نتائج ويب حية بنفس طريقة تصفح ChatGPT. وجهه على ملفاتك وهو يجاوب أسئلة منها، الحركة المسماة retrieval (RAG)، فتقدر تسأل عن مستندات بدون ما ترفعها لأي مكان. اربط فيه نموذج صور محلي ويسوي صور بعد. ولا شي من هذا يرفع سقف التفكير، لأن النموذج اللي تحت ما زال محلي صغير. اللي يسويه هو تحويل الإعداد لشي أقرب لمساعد كامل من صندوق محادثة فاضي، وكل شي محفوظ على عتادك.
العتاد يقرر كل شي
هذا هو التطبيق الوحيد في السلسلة اللي العتاد فيه يقرر كل شي. الرقم اللي يهم هو ذاكرة الـ GPU (الـ VRAM). النماذج الأكبر تحتاج أكثر منها، والنماذج الأقدر أكبر. والنموذج يشتغل على CPU عادي بعد، هو بس أبطأ بكثير، وهذا تمام للسؤال العابر ومؤلم للأخذ والرد الحقيقي.
| الإعداد | VRAM | الواقع |
|---|---|---|
| CPU فقط | ولا شي | يشغل نماذج صغيرة، بس أبطأ من إنه ينفع لمحادثة حقيقية. تمام للتجربة ومو أكثر. |
| فئة RTX 3060 / 3080 | 8 إلى 12 GB | وين أنا قاعد. يتكفل بنماذج 7 إلى 14 مليار باراميتر اللي تغطي أغلب المهام اليومية، بسرعة تحسها حية. |
| فئة RTX 4080 / 4090 | 16 إلى 24 GB+ | يشغل النماذج الأكبر أبو 30 مليار باراميتر وسياقات أطول. يستاهل بس إذا تضغط على الـ AI المحلي بقوة. |
الـ GPU يسحب كهرباء حقيقية وهو يولد، فهذي الخدمة المستضافة ذاتيا النادرة اللي الكهرباء فيها بند حقيقي في الفاتورة. تحقق من حقتك بـ حاسبة كهرباء الهوم لاب (بالإنجليزي). وإذا توزن كرت تملكه مقابل استئجار GPU بالساعة، فصلت هالموضوع في نماذج LLM المحلية ضد GPU سحابي (بالإنجليزي).
الفلوس، مدفوعة مقدما
ChatGPT Plus بـ 75 ريال بالشهر (20 دولار)، يعني 900 ريال بالسنة و 2,700 على ثلاث سنوات، وهو ثابت على هالسعر من سنين وهو يتحسن. الاستضافة الذاتية تقلب التكلفة للمقدمة. البرامج مجانية، بس GPU قادر هو شراء مقدم حقيقي، والكرت يسحب شوي وهو خامل، ويسحب كم مئة واط وهو يولد. إذا بس تمد يدك للـ AI بين فترة وفترة، الاشتراك أو حتى الطبقة المجانية أرخص وأذكى من شراء كرت شاشة. المحلي يفوز لما تعتمد عليه للمهام اليومية السريعة، أو لما ترفض رفض قاطع ترسل برومبتاتك لشركة، أو لما الكرت أصلا عندك للقيمنق أو شغل ثاني. حط أرقامك وتعرفة كهربك في حاسبة الاستضافة الذاتية ضد SaaS، معبأة مسبقا بسعر ChatGPT Plus (بالإنجليزي) وشف وين تطلع.
ليش أنا فعلا أشغله
شل الفلوس والسرعة واللي يظل واقف هو الخصوصية. كل شي تكتبه يظل على عتادك، فتقدر تعطيه ملاحظات خاصة أو مستند سري تبغى تلخصه أو نص عمرك ما تلصقه في سحابة أحد غيرك، وما تفكر مرتين. ولا حدود استخدام، وولا تدريب على بياناتك، لأن ما فيه أحد غيرك في المعادلة. ولا اشتراك يقدم هذا بأي سعر، ولبعض الناس هو الشي الوحيد اللي يهم. وهو سبب تشغيلي له.
تشغيله
ما فيه شي تنقله، لأن هذا مساعد جديد مو خدمة تهاجرها. تثبت Ollama، وتسحب نموذج بأمر واحد، وتشغل Open WebUI في container، وتوجهها على Ollama. بعد كم دقيقة عندك محادثة خاصة في متصفحك. بعدها تجرب كم نموذج وتبقي اللي يناسب عتادك وشغلك.
متى تدفع لـ ChatGPT وخلاص
اتركها إذا تحتاج أذكى إجابة ممكنة لشغل صعب فعلا، مثل التفكير الثقيل أو مهام البرمجة الكبيرة. نماذج frontier المستضافة تغلب أي شي تشغله في البيت، واشتراك بـ 75 ريال (20 دولار) هو الطريق الأرخص لها. واتركها بعد إذا ما عندك GPU وما عندك صبر على CPU بطيء. استضف الـ AI ذاتيا لما الخصوصية تهمك، أو لما تستخدمه بما يكفي إن الاستخدام المحلي غير المحدود يعوض عليك، أو لما كرت الشاشة أصلا عندك وتبغى تطلع منه أكثر.
أسئلة شائعة
هل النموذج المحلي بنفس جودة ChatGPT؟
لا، مو لأي شي متطلب. النموذج المحلي على عتاد استهلاكي مفيد للمهام الصغيرة السريعة، سؤال سريع أو إعادة صياغة سريعة أو تلخيص قصير. ولأي شي متطلب هو متأخر كثير عن نماذج frontier المستضافة. استخدمه للسريع وللخصوصية، مو كبديل كامل لـ ChatGPT.
وش الـ GPU اللي أحتاجه لتشغيل AI محلي؟
كرت بذاكرة 8 إلى 12 GB يضرب النقطة الحلوة ويشغل نماذج 7 إلى 14 مليار باراميتر الشائعة زين. ذاكرة أكثر تعني نماذج أكبر وأقوى. كمية الـ VRAM تهم أكثر من السرعة الخام.
أقدر أشغله بدون GPU؟
نعم، على الـ CPU، بنماذج صغيرة. يمشي للسؤال العابر بس أبطأ من إنك تستمتع بمحادثة حقيقية. الـ GPU هو اللي يخليه يحس إنه حي.
هل المساعد المستضاف ذاتيا فعلا خاص؟
نعم. مع Ollama و Open WebUI النموذج يشتغل بالكامل على عتادك، فبرومبتاتك عمرها ما تطلع من شبكتك وولا شي يستخدم لتدريب نموذج أحد. وهذا السبب الرئيسي لتشغيله.
يقدر المساعد المحلي يبحث في الويب؟
نعم. اقرن Open WebUI بـ SearXNG، محرك بحث مستضاف ذاتيا، ونموذجك المحلي يسحب نتائج ويب حية، قريب من تصفح ChatGPT. وتقدر تضيف البحث في المستندات وتوليد الصور بنفس الطريقة، بقطع محلية ثانية، كلها محفوظة على عتادك.
أي نماذج أشغل؟
عوائل Llama و Qwen و Gemma و Phi المفتوحة هي الاختيارات المعتادة. اختر حجم يركب على الـ VRAM حقك، ومل نحو Qwen للبرمجة. جرب اثنين أو ثلاثة وأبق الأفضل لعتادك.
ChatGPT علامة تجارية لشركة OpenAI. دليل تك غير مرتبط بها ولا معتمد منها.