يعد تجميع الكلمات الرئيسية أحد مهام تحسين محركات البحث التي تبدو بسيطة حتى تحدق في جدول بيانات يحتوي على 12000 صف وعمود “التجميع حسب النية” الذي تملأه يدويًا.
لا يتم قياس التجميع اليدوي، ويفتقد التجميع المستند إلى القواعد التداخل الدلالي بين العبارات التي لا تشترك في كلمة واحدة ولكن من الواضح أنها تنتمي معًا.
لقد قمت بإعادة بناء البرنامج النصي لتجميع الكلمات الرئيسية الذي قمت بتطويره قبل بضع سنوات. يستخدم الإطار توجيه TF-IDF لإنشاء ناقلات الميزات، والتي يتم بعد ذلك تجميعها باستخدام HDBSCAN، وهي خوارزمية تجميع قائمة على الكثافة. يمكنك العثور على البرنامج النصي هنا.
مشكلة تجميع الكلمات الرئيسية
تجميع الكلمات الرئيسية هو المحفز لتوليد الموضوع. بدلاً من إحاطة كتاب المحتوى بمئات من الكلمات الرئيسية الفردية، يتيح لك التجميع تجميع الاستعلامات ذات الصلة لغويًا في موضوعات متماسكة، مما يجعل من الأسهل بكثير إنتاج محتوى يرضي نطاقًا أوسع من غرض البحث.
والنتيجة هي مجموعة من المواضيع التي يمكن أن تعزز العلاقات الدلالية، والسلطة الموضعية، والربط الداخلي، والرؤية عبر الاستعلامات ذات الصلة.
هناك تحديان رئيسيان هنا: المعالجة المسبقة للبيانات وتجميع المواضيع.
المعالجة المسبقة للبيانات
غالبًا ما تكون عمليات تصدير الكلمات الرئيسية لتحسين محركات البحث (SEO) مزعجة، خاصة إذا كانت تأتي من قواعد البيانات الخاصة بك. لا يمكن إجراء إزالة كلمات التوقف والأحرف غير ASCII يدويًا، ومن هنا تأتي الحاجة إلى أتمتة عملية تنظيف البيانات على نطاق واسع.
يعد Python حلاً مباشرًا لأنه يوفر المرونة اللازمة لإنشاء مسار يمكنه تنظيف مجموعات بيانات الكلمات الرئيسية الكبيرة وتطبيعها وتحويلها بأقل قدر من التدخل اليدوي.
تجميع المواضيع
عند تحليل بيانات الكلمات الرئيسية، نادرًا ما تعرف عدد المجموعات الموضعية الموجودة حتى تستكشف مجموعة البيانات. وهذا يجعل الخوارزميات مثل k-means غير مناسبة، لأنها تتطلب منك تحديد عدد المجموعات مسبقًا.
أثبت الجمع بين TF-IDF وHDBSCAN فعاليته بشكل خاص. يقوم TF-IDF بتحويل كل كلمة رئيسية إلى متجه رقمي عن طريق تعيين وزن أكبر للمصطلحات المميزة ضمن مجموعة البيانات مع تقليل وزن تلك التي تظهر بشكل متكرر عبر العديد من الكلمات الرئيسية.
يتم بعد ذلك تغذية هذه المتجهات في HDBSCAN، وهي خوارزمية تجميع قائمة على الكثافة تحدد التجمعات الطبيعية دون الحاجة إلى تحديد عدد المجموعات مسبقًا.
إحدى المزايا الرئيسية لـ HDBSCAN هي قدرته على تحديد الضوضاء. بدلاً من فرض كل كلمة رئيسية في مجموعة، فإنها تقوم بتعيين قيم متطرفة للتسمية -1، مما يعني أنها تستبعد الكلمات الرئيسية التي لا تنتمي إلى أي موضوع.

يعد هذا مفيدًا بشكل خاص لمجموعات بيانات تحسين محركات البحث، حيث تحتوي صادرات الكلمات الرئيسية غالبًا على استعلامات طويلة محددة للغاية لا تتناسب بشكل طبيعي مع المجموعات المواضيعية الأوسع.
بدلاً من تدهور جودة المجموعة عن طريق تعيين هذه المصطلحات بشكل تعسفي، يقوم HDBSCAN بعزلها، مما يؤدي إلى إنتاج مجموعات موضعية أكثر نظافة وتماسكًا.
كن العلامة التجارية يجد العملاء أولاً.
تتبع ونمو وقياس ظهورك عبر Google وبحث الذكاء الاصطناعي والوسائط الاجتماعية والمحلية وكل قناة تؤثر على قرارات الشراء.
ابدأ تجربتك المجانية
الحصول على قائمة الكلمات الرئيسية من BigQuery
قبل إجراء أي تجميع، تحتاج إلى قائمة كلمات رئيسية – وإذا كان موقعك في Search Console يتم تصديره بالفعل إلى BigQuery، فهذا مصدر أفضل من تصدير واجهة المستخدم، نظرًا لأنه لا يقتصر على 1000 صف ولا يتم أخذ عينات منه.
تبدو عملية سحب بسيطة مقابل مخطط تصدير GSC BigQuery القياسي كما يلي:


قم بتصدير النتيجة كملف CSV، وتقسيمها إلى عمود استعلام واحد، وحفظها كملف بتنسيق txt مع كلمة رئيسية واحدة في كل سطر، وهذا هو مدخل التجميع الخاص بك.
إذا لم تقم بإعداد BigQuery Export، فلا يزال بإمكانك العمل مع بيانات Search Console، ولكن سيكون لديك مجموعة بيانات أكثر محدودية للعمل بها.
على أية حال، يمكنك تصدير الاستعلامات من واجهة Search Console، فالدفتر لا يهتم إلا بإطعامه قائمة من الكلمات الرئيسية.
مطالبة منظمة العفو الدولية
قبل بضع سنوات، كنت أتفق مع نسخة أقل مصقولة من هذا السيناريو.
لقد جعل الذكاء الاصطناعي الأمور التالية أسهل عند إعادة التشغيل وضبط البرنامج النصي لتحسين الإخراج.
السؤال عن المعلمات القابلة للضبط، وليس المعلمات المشفرة
تتصرف حساسية المجموعة والحد الأدنى لحجم المجموعة بشكل مختلف تمامًا اعتمادًا على ما إذا كنت تقوم بتجميع 50 كلمة رئيسية أو 50000 كلمة رئيسية. إن طلب هذه المتغيرات كمتغيرات قابلة للتعديل في الأعلى يعني أنه يمكنني إعادة ضبطها دون لمس المنطق.
تحديد البيئة
كان الإصدار الأول عبارة عن برنامج نصي عادي من نوع Python يُقصد به التشغيل من محطة طرفية. نظرًا لأن سير العمل الفعلي هو “سحب الكلمات الرئيسية، وتشغيل دفتر الملاحظات، وتسليم ملف للعميل،” فقد طلبت إصدارًا خاصًا بـ Google Colab، والذي يغير شكل الكود (محاولة/باستثناء الكتل حول عمليات استيراد Colab فقط، بدون argparse) أكثر مما قد يوحي به قرص صغير. كما أنها أتاحت تصورًا أفضل من خلال الاستفادة من Plotly على أكمل وجه.
احصل على النشرة الإخبارية التي يعتمد عليها مسوقو البحث.
تشغيل الكود
كان جوهر النص ولا يزال بسيطًا. يأخذ قائمة مسطحة من الكلمات الرئيسية ويجمعها تلقائيًا في مجموعات المواضيع.
كل ما عليك فعله هو تحميل ملف .txt بكلمة رئيسية واحدة في كل سطر، وسيقوم بتنظيف النص (إزالة الأحرف الخاصة وكلمات التوقف والإدخالات غير الإنجليزية).
يعد استخدام المعلمات القابلة للضبط هو مفتاح الإطار بأكمله. العب مع الحساسية و min_cluster_size حدود. اضبطها بناءً على حجم قائمة كلماتك الرئيسية.


بمجرد أن تكون راضيًا عن عدد المجموعات، يتم استخدام TF-IDF لتسجيل مدى أهمية كل كلمة داخل المجموعة. HDBSCAN ثم ينهي العملية.
تحصل كل مجموعة على تصنيف يتم إنشاؤه تلقائيًا استنادًا إلى مصطلحاتها الأكثر تميزًا، ويتم تصدير النتائج إلى ملف Excel مع عرض مجموعة مجمعة وتفصيل كامل لكل كلمة رئيسية على حدة.


حيث يضيف الذكاء الاصطناعي قيمة
القرارات المهمة بالفعل، بدءًا من اختيار TF-IDF على تضمينات الكلمات إلى اختيار HDBSCAN لأن عدد المواضيع غير معروف، لا تزال تتطلب فهمًا لكيفية عمل مجموعات الكلمات الرئيسية.
ما أزاله الذكاء الاصطناعي هو العمل المتكرر المتمثل في إعادة بناء التعليمات البرمجية النمطية، وتوصيل المكتبات ببعضها البعض، وتحسين دفتر الملاحظات إلى شيء يمكن إعادة استخدامه.
والنتيجة النهائية هي أداة تجميع خفيفة الوزن يمكنها معالجة آلاف الكلمات الرئيسية في دقائق، مما يؤدي إلى إنتاج مسودة أولية معقولة لتصنيفك الموضعي. لن يحل محل الحكم التحريري، ولكنه سيقضي على ساعات من التجميع اليدوي ويمنح فريق المحتوى الخاص بك نقطة بداية أكثر تنظيمًا.
إذا قمت بالفعل بتصدير بيانات Search Console إلى BigQuery، فستصبح هذه خطوة طبيعية في سير عملك: قم باستخراج استعلاماتك، وتشغيل دفتر الملاحظات، ومراجعة المجموعات، والبدء في تخطيط المحتوى استنادًا إلى الموضوعات بدلاً من الكلمات الرئيسية المعزولة.
تتم دعوة المؤلفين المساهمين لإنشاء محتوى لـ Search Engine Land ويتم اختيارهم لخبرتهم ومساهمتهم في مجتمع البحث. يعمل المساهمون لدينا تحت إشراف هيئة التحرير ويتم فحص المساهمات للتأكد من جودتها وملاءمتها لقرائنا. Search Engine Land مملوكة لشركة Semrush. لم يُطلب من المساهم الإشارة بشكل مباشر أو غير مباشر إلى Semrush. الآراء التي يعبرون عنها هي آرائهم الخاصة.
اكتشاف المزيد من اشراق اون لاين - تقنية المواقع
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
