عندما تستخدم خدمة سحابية لتحويل الكلام إلى نص، مثل Google Speech-to-Text أو OpenAI's Whisper API، فإن التسجيلات الصوتية الخاصة بك تنتقل عبر الشبكة إلى خوادم لا تتحكم فيها. تخيل أنك تقوم بتحويل مكالمات عمل تحتوي على أسماء عملاء ومعلومات مشاريع حساسة، أو حتى مناقشات تسعير. إرسال هذا الصوت إلى خادم طرف ثالث يعني أنك تفقد السيطرة على مكان معالجته أو تخزينه. هذا هو المكان الذي تبرز فيه أهمية الخصوصية.
الحل الذي طبقه المطور بسيط وفعال: تشغيل نموذج Whisper محليًا على خادم خاص به مزود ببطاقة رسوميات RTX 3060 (بذاكرة VRAM 12 جيجابايت). بهذه الطريقة، تبقى الملفات الصوتية على الجهاز نفسه. يتم رفع التسجيلات من الهاتف عبر تطبيق ويب تقدمي (PWA)، وتُخزن وتُعالج في نفس الخادم. هذا يعني عدم وجود اتصالات بواجهة برمجة تطبيقات خارجية، ولا رؤوس مصادقة (auth headers)، ولا سجلات طلبات يتم الاحتفاظ بها لدى بائع خارجي. يبقى الصوت في أمان داخل بيئتك الخاصة.
والأمر المثير للإعجاب هو كيفية إدارة الموارد. على الرغم من أن بطاقة RTX 3060 يتم مشاركتها مع نموذجَيْن آخَرين، فإن نموذج Whisper المتوسط في وضع int8 يحتاج إلى حوالي 2.5 إلى 3 جيجابايت فقط من ذاكرة VRAM عند تشغيله. يتم تحميل النماذج الثلاثة بالتسلسل: تحويل الكلام إلى نص أولاً، ثم تضمين البيانات، وأخيرًا التحليل. هذا الترتيب يضمن حصول Whisper على الموارد الكافية في البداية.
وفي حال أصبح الضغط على بطاقة الرسوميات كبيرًا، مثلما يحدث عند معالجة المهام الثقيلة، يتحول Whisper تلقائيًا إلى العمل على وحدة المعالجة المركزية (CPU). نعم، يكون أبطأ قليلاً – من 30 إلى 60 ثانية لكل دقيقة صوتية بدلاً من 8 إلى 12 ثانية – ولكنه يستمر في العمل دون أعطال. هذا الاحتياطي الذكي يضمن استمرارية الخدمة حتى في ظروف التحميل العالية، مما يبرز مدى التفكير في تصميم هذا الحل المحلي.