← वापस लकड़ी की मेज पर खुला हुआ पुराना शब्दकोश, सुनहरी दोपहर की रोशनी और उथली गहराई क्षेत्र के साथ

मशीन अनुवाद + मानवीकरण: वह पाइपलाइन जो रैंक करती है

2023 की शुरुआत में एक क्लाइंट मुझे सच में घबराहट में कॉल किया। उन्होंने एक एजेंसी (Seahawk नहीं, वैसे) को अपनी ई-कॉमर्स साइट को फ्रेंच, जर्मन और स्पेनिश में स्थानीयकृत करने के लिए लगभग £14,000 का भुगतान किया था। आठ महीने बाद, उन तीनों स्थानों से शून्य ऑर्गेनिक इंप्रेशन। सामग्री मौजूद थी। Google ने इसे इंडेक्स किया था। कोई क्लिक नहीं, कोई रैंकिंग नहीं, और कोई भी यह पता नहीं लगा सकता था कि क्यों।

मैंने जर्मन प्रोडक्ट पेज में से एक खोला। तीन वाक्यों में, मुझे समस्या दिख गई। कॉपी 2011 के Google Translate स्क्रीनशॉट जैसी पढ़ी। तकनीकी रूप से सही। पूरी तरह अप्राकृतिक। कोई भी जर्मन भाषी "Das Produkt ist sehr gut für Ihre Bedürfnisse geeignet" नहीं लिखता। जब तक वह एक रोबोट न हो जो PowerPoint डेक को ट्रांसक्राइब कर रहा हो।

यह मशीन अनुवाद का जाल है। और मैं इसे लगातार देखता हूँ, Seahawk में जिन 12,000+ साइटों को हमने छुआ है, उन सभी में। कच्चा MT आउटपुट रैंक नहीं करता क्योंकि Google की गुणवत्ता सिग्नल तकनीकी रूप से सही विदेशी पाठ से मूर्ख नहीं होते। न ही उपयोगकर्ता। और जब उपयोगकर्ता 4 सेकंड में बाहर आ जाते हैं, तो रैंकिंग सिग्नल लूप तेजी से ढह जाता है।

यहाँ वह पाइपलाइन है जो वास्तव में काम करती है।

---

कच्चा MT सर्च में क्यों विफल होता है (और यह वह नहीं है जो आप सोचते हैं)

अधिकांश लोग मानते हैं कि MT व्याकरण त्रुटियों के कारण विफल होता है। यह गलत निदान है।

DeepL जैसे आधुनिक उपकरण वास्तव में प्रभावशाली हैं। DeepL के अनुवाद, विशेषकर यूरोपीय भाषाओं के लिए, अक्सर व्याकरणिक रूप से स्वच्छ होते हैं। समस्या कुछ अधिक सूक्ष्म है: सांस्कृतिक रजिस्टर और खोज इरादे का असंतुलन।

भाषाओं में खोज इरादे की समस्या

जब एक फ्रेंच उपयोगकर्ता Google में "chaussures de course femme pas cher" टाइप करता है, तो वह एक बहुत ही विशिष्ट इरादा दे रहा है। आपके "cheap women's running shoes" पेज का शाब्दिक अंग्रेजी-से-फ्रेंच अनुवाद संभवतः उस वाक्यांश को तैयार करेगा। ठीक है। लेकिन बॉडी कॉपी, हेडिंग, FAQ संरचना, वह तरीका जिससे आप पाठक को संबोधित करते हैं, सब कुछ अंग्रेजी-भाषी सामग्री की लय को फ्रेंच पोशाक पहने हुए ले जाएगा।

फ्रेंच पाठक इसे नोटिस करते हैं। फ्रेंच क्रॉलर (अर्थात्, fr लोकेल के लिए पेज को रेंडर करने वाली Googlebot) एनगेजमेंट को मापते हैं। छोटे सेशन, उच्च बाउंस, कम स्क्रॉल गहराई। वे सिग्नल आपको नीचे धकेलते हैं।

मैंने 2023 के मध्य में Seahawk फैशन क्लाइंट की फ्रेंच साइट पर एक A/B टेस्ट चलाया। Version A शुद्ध DeepL आउटपुट था, व्याकरण के लिए प्रूफरीड। Version B वही DeepL आधार था, एक मूल फ्रेंच संपादक द्वारा प्रति पेज 25 मिनट के लिए चलाया गया। Version B में छह सप्ताह के भीतर 34% कम बाउंस दर थी। समान URLs, समान बैकलिंक, समान तकनीकी सेटअप। केवल मानवीकरण परत बदली।

---

मैं जो उपकरण वास्तव में उपयोग करता हूँ (क्रम में)

देख, मैंने बहुत सारी चीजें आजमाई हैं। यहाँ MT-प्लस-मानव कार्य के लिए वर्तमान Seahawk स्टैक है।

  1. आधार अनुवाद के लिए DeepL Pro। Google Translate नहीं। "यह अनुवाद करो" पर सेट ChatGPT नहीं। DeepL का न्यूरल मॉडल उच्च-गुणवत्ता की द्विभाषिक कॉर्पस पर प्रशिक्षित है और अधिकांश यूरोपीय भाषाओं के लिए आउटपुट काफी स्वच्छ है। जापानी और कोरियाई के लिए, मैं एक कस्टम GPT-4o प्रॉम्प्ट पर अधिक भरोसा करता हूँ जो हमने आंतरिक रूप से बनाया है, क्योंकि DeepL की एशियाई भाषा की गुणवत्ता अधिक असंगत है।
  2. अनुवाद स्मृति और शब्दावली प्रबंधन के लिए Phrase (पूर्व में Memsource)। यदि किसी क्लाइंट के पास ब्रांड शर्तें, प्रोडक्ट नाम, या विशिष्ट टैगलाइन हैं जिन्हें अनुवाद नहीं किया जाना चाहिए, तो Phrase हर पेज, हर स्प्रिंट, हर संपादक में इसे सुसंगत रखता है। TM टूलिंग के बिना, आप एक पेज पर "Shopping Cart" प्राप्त करते हैं और दूसरे पर "Panier" और तीसरे पर "Panier d'achat"। सुसंगतता क्रॉलर के लिए मायने रखती है।
  3. एक मूल मानव संपादक। यह अनिवार्य है। मैं Workana और ProZ के माध्यम से मुख्य रूप से खट्टे हुए फ्रीलांसरों का एक नेटवर्क उपयोग करता हूँ। पेशेवर अनुवादक जो एक नया पास कर रहे हैं, वह महंगा और धीमा है। मैं उन्हें संपादक के रूप में उपयोग करता हूँ: प्रति 800-शब्द पेज 20-30 मिनट, केवल तीन चीजों पर केंद्रित: प्राकृतिक वाक्यांश, सांस्कृतिक संदर्भ स्वैप, और CTA भाषा।
  4. लक्ष्य भाषा में ऑन-पेज ऑप्टिमाइजेशन के लिए Surfer SEO (या कुछ क्लाइंट के लिए Clearscope)। आप अपने अंग्रेजी कीवर्ड डेटा का उपयोग नहीं कर सकते और यह मान सकते हैं कि यह स्वच्छता से मैप करता है। मैंने क्लाइंट को एक फ्रेंच कीवर्ड के लिए जुनूनी रूप से अनुकूल करते हुए देखा है जो प्रति माह 40 खोज प्राप्त करता है जब वास्तविक उच्च-मात्रा वाक्यांश कुछ थोड़ा अलग है। Surfer का Content Editor फ्रेंच, जर्मन, स्पेनिश, पुर्तगाली और कुछ अन्य में काम करता है।
  5. देश की संपत्ति द्वारा विभाजित Google Search Console। एक भी स्थानीयकृत पेज लॉन्च करने से पहले यह सेट करें। आपको दिन एक से प्रति-लोकेल डेटा की आवश्यकता है।

---

मानवीकरण ब्रीफ: मैं संपादकों को क्या कहता हूँ

यहीं अधिकतर पाइपलाइनें लीक होती हैं। आप बस यह नहीं कह सकते कि "इसे प्राकृतिक लगना चाहिए" और DeepL दस्तावेज़ किसी फ्रीलांसर को भेज दें। मैंने यह किया है। इससे असंगत परिणाम आते हैं और सभी का समय बर्बाद होता है।

मेरी मानक मानवीकरण ब्रीफ चार चीजें कवर करती है:

  • रजिस्टर: क्या यह औपचारिक है या अनौपचारिक? जर्मन "du" बनाम "Sie" एक व्यवसायिक निर्णय है, व्याकरण प्रश्न नहीं। गलत करें और आप तुरंत गलत ब्रांड पोजीशनिंग संकेत देते हैं।
  • मुहावरे की अदला-बदली: स्रोत में कोई भी अंग्रेजी मुहावरे को फ़्लैग करें और संपादक से उन्हें शाब्दिक अनुवाद के बजाय मूल समकक्षों से बदलने के लिए कहें। "Hit the ground running" फ्रेंच में एक मुहावरा नहीं है। यह भ्रम है।
  • CTA फिर से लिखना: हर कॉल-टू-एक्शन को नया लिखा जाता है, अनुवाद नहीं किया जाता। जर्मन में "Buy Now" व्याकरणिक रूप से "Jetzt kaufen" बन जाता है, लेकिन एक मूल संपादक को पता हो सकता है कि "Gleich bestellen" उनके बाजार में बेहतर रूपांतरण करता है। उन्हें निर्णय लेने दें।
  • लंबाई सहिष्णुता: कुछ भाषाएं काफी हद तक विस्तारित होती हैं। जर्मन कुख्यात है। 250-शब्द का अंग्रेजी अनुभाग अक्सर जर्मन में 310+ शब्दों में बदल जाता है। इसे अपने लेआउट टेम्पलेट में शामिल करें या आपके पास हर डिवाइस पर टूटे हुए डिज़ाइन होंगे।

Seahawk के पास 2022 में एक SaaS क्लाइंट था जहां उनके मूल्य निर्धारण पृष्ठ का जर्मन संस्करण पूरी तरह से कार्ड लेआउट को तोड़ गया क्योंकि किसी ने पाठ विस्तार के लिए बजट नहीं बनाया था। हमने इसे QA में पकड़ा लेकिन इसमें हमारे दो दिन लगे। अब यह हर ब्रीफ में है जो हम भेजते हैं।

---

लक्ष्य भाषा में कीवर्ड अनुसंधान: इसे शुरुआत से करें

मैं इस पर पर्याप्त जोर नहीं दे सकता। आपका अंग्रेजी कीवर्ड अनुसंधान एक शुरुआती बिंदु है, नक्शा नहीं।

2020 में, मैंने इतालवी बाजार को लक्षित करने वाली एक यात्रा साइट पर काम किया। क्लाइंट के पास "budget hotels Rome" के लिए अनुकूलित एक अंग्रेजी पृष्ठ था जो ठीक से रैंक कर रहा था। हमने इसे इतालवी में अनुवाद किया, "hotel economici Roma" (शाब्दिक अनुवाद) के लिए अनुकूलित किया, और यह तीन महीने तक पद 18 में लड़खड़ाया।

फिर एक मूल इतालवी संपादक ने बताया कि इतालवी उपयोगकर्ता अधिक सामान्यतः "hotel a basso costo Roma" या यहां तक कि "hotel conveniente Roma" खोजते हैं। हमने प्राथमिक वाक्यांश को स्वैप किया और मेटा को फिर से लिखा। आठ सप्ताह में, पद 6। समान डोमेन अथॉरिटी, समान बैकलिंक, समान पृष्ठ संरचना।

Google Keyword Planner आपको भाषा और स्थान सेटिंग स्विच करने देता है। वह आपका शुरुआती बिंदु है। फिर लक्ष्य देश के लिए फ़िल्टर किए गए Ahrefs या Semrush के साथ क्रॉस-रेफरेंस करें। देखें कि आपके वास्तविक स्थानीय प्रतियोगी किसके लिए रैंक कर रहे हैं, न कि आप क्या मानते हैं कि वे लक्ष्य करेंगे।

एक और बात: खोज मात्रा सीमा बाजारों में भिन्न हैं। 800 मासिक खोजों के साथ एक फ्रेंच कीवर्ड का पीछा करने के लायक हो सकता है। UK में, मैं शायद इसे छोड़ दूंगा। बाजार आकार संदर्भ महत्वपूर्ण है।

---

तकनीकी सेटअप: hreflang, सबफोल्डर, और मुझे जो गलतियां दिख रही हैं

कंटेंट पाइपलाइन केवल आधी है। तकनीकी scaffolding या तो आपके काम को बढ़ाता है या चुपचाप इसे रद्द कर देता है।

hreflang टैग

उन्हें सही तरीके से करें या परेशान न करें। Google का hreflang दस्तावेज़ इस पर स्पष्ट है: हर स्थानीयकृत पृष्ठ को द्विपक्षीय hreflang कार्यान्वयन की आवश्यकता है। आपका अंग्रेजी पृष्ठ आपके फ्रेंच पृष्ठ की ओर इशारा करता है, आपका फ्रेंच पृष्ठ वापस आपके अंग्रेजी पृष्ठ और हर दूसरे लोकेल की ओर इशारा करता है। श्रृंखला में एक लिंक मिस करें और पूरा सिग्नल गिरावट में आता है।

मैं शायद Seahawk के माध्यम से साल में 40-50 साइटों पर hreflang कार्यान्वयन का ऑडिट करता हूं। मैं कहूंगा कि उनमें से 60% में कम से कम एक टूटा हुआ या लापता पारस्परिक टैग है। हर डिप्लॉय के बाद Screaming Frog के hreflang वेलिडेटर का उपयोग करें।

सबफोल्डर बनाम सबडोमेन

मेरी डिफ़ॉल्ट सिफारिश सबडोमेन (fr., de.) पर सबफोल्डर (/fr/, /de/) है। डोमेन अथॉरिटी समेकन इसके लायक है, और अधिकतर CMS सेटअप में सबफोल्डर प्रबंधन करना आसान है। सबडोमेन बहुत विशिष्ट स्थितियों में समझ बनाते हैं, आमतौर पर जहां अंतरराष्ट्रीय संस्करण को एक अलग CMS की आवश्यकता होती है या काफी हद तक भिन्न तकनीकी आर्किटेक्चर है।

कैनोनिकल टैग

आत्म-संदर्भात्मक कैनोनिकल के लिए देखें जो अंग्रेजी पृष्ठ की ओर इशारा करते हैं। यह एक WordPress प्लगइन समस्या है। कुछ बहुभाषी प्लगइन (आप पर नज़र रखते हुए, पुराने WPML कॉन्फ़िगरेशन) अनुवादित पृष्ठों पर कैनोनिकल को मूल अंग्रेजी URL पर सेट करने के लिए प्रयोग किया करते थे। वह एकल गलत कॉन्फ़िगरेशन आपके पूरे स्थानीकरण प्रयास को डुबो देगा। लॉन्च दिवस पर हर लोकेल के कैनोनिकल को जांचें।

---

पाइपलाइन को मापना: मैं किन संख्याओं पर नज़र रखता हूं

लॉन्च के बाद, यहां बताया गया है कि मैं क्या ट्रैक करता हूं और मोटे तौर पर मुझे कब आंदोलन दिखने की उम्मीद है:

  • सप्ताह 1-4: GSC में प्रत्येक स्थान के लिए इंडेक्सेशन दर। यदि Google आपके स्थानीयकृत पृष्ठों को दो सप्ताह में इंडेक्स नहीं कर रहा है, तो आपके पास क्रॉल या साइटमैप समस्या है।
  • सप्ताह 4-10: GSC में देश के अनुसार इंप्रेशन। क्लिक से पहले इंप्रेशन। यदि इंप्रेशन बढ़ रहे हैं, तो कंटेंट विचार सेट में प्रवेश कर रहा है। यदि इंप्रेशन स्थिर हैं, तो कीवर्ड या कंटेंट गुणवत्ता को दोबारा देखना होगा।
  • सप्ताह 8-16: लक्षित वाक्यांशों पर औसत स्थिति आंदोलन। यह वह जगह है जहाँ आप मानवीकरण कार्य को फल देते हुए देख सकते हैं। ऐसे पृष्ठ जो उपयोगकर्ताओं को तेजी से बाहर निकालते हैं, यहाँ आपके hreflang कितना भी अच्छा हो, आगे नहीं बढ़ेंगे।
  • महीना 4+: स्थानीयता के अनुसार ऑर्गेनिक सत्र और साइट-पर एनगेजमेंट। बाउंस दर, सत्र अवधि, प्रति सत्र पृष्ठ। ये पिछड़े हुए संकेतक हैं जो पुष्टि करते हैं कि पाइपलाइन ने वास्तव में उपयोगी कंटेंट तैयार किया या सिर्फ मशीन अनुवाद को सजाया।

ईमानदार जवाब: एक अच्छी तरह से निष्पादित MT-प्लस-ह्यूमनाइजेशन पृष्ठ, स्वच्छ तकनीकी सेटअप और समझदारीपूर्ण कीवर्ड लक्ष्यीकरण के साथ, आमतौर पर सप्ताह 10 और 20 के बीच मध्यम प्रतिस्पर्धी स्थानीयताओं में सार्थक रैंकिंग आंदोलन दिखाता है। कम-प्रतिस्पर्धा बाजारों में तेजी से। जर्मनी या फ्रांस जैसी अत्यधिक प्रतिस्पर्धी बाजारों में धीमा, जहाँ स्थानीय प्रकाशक मजबूत हैं।

---

यह पाइपलाइन वास्तव में लागत क्या है

मैं आपको वास्तविक संख्याएँ दूँगा क्योंकि अस्पष्ट श्रेणियाँ बेकार हैं।

एक मानक 800-शब्द पृष्ठ को एक भाषा में अनुवाद करने के लिए:

  • DeepL Pro: वर्तमान API मूल्य निर्धारण पर मोटे तौर पर £0.04 प्रति शब्द। इसे £32 प्रति पृष्ठ मानें।
  • मानव संपादक: Workana पर एक अच्छा B2-स्तरीय मूल संपादक 25-मिनट के पास के लिए £18-35 प्रति पृष्ठ लेता है। मैं £25 का बजट रखता हूँ।
  • Surfer SEO कंटेंट ऑप्टिमाइजेशन पास (इन-हाउस किया गया): आपकी आंतरिक दर पर 30 मिनट।

तो स्थानीयकृत पृष्ठ की कठोर लागत आपके समय से पहले £55-60 के आसपास है। इसकी तुलना £120-180 प्रति पृष्ठ के पूर्ण मानव अनुवाद से करें। आप 50-60% बचा रहे हैं और मेरे अनुभव में, गुणवत्ता की छत इतनी करीब है कि Google अंतर नहीं बता सकता, यदि मानवीकरण सही तरीके से किया जाए।

जहाँ आपको अभी भी पूर्ण मानव अनुवाद का उपयोग करना चाहिए: कानूनी कंटेंट, चिकित्सा कंटेंट, कुछ भी जहाँ गलत अनुवाद देयता पैदा करता है। शर्तें-सेवा पृष्ठ को DeepL के माध्यम से न चलाएँ और इसे पूर्ण मानें।

---

FAQ

क्या Google मशीन-अनुवादित कंटेंट को दंडित करता है?

स्वचालित रूप से नहीं। Google की स्पैम नीतियाँ "खोज रैंकिंग में हेरफेर करने के प्राथमिक उद्देश्य के साथ" बनाए गए स्वचालित-जेनरेट कंटेंट को उल्लंघन के रूप में उल्लेख करती हैं। कार्यशील वाक्यांश "प्राथमिक उद्देश्य" है। ऐसी MT कंटेंट जो वास्तव में उपयोगकर्ताओं को उनकी भाषा में सेवा देती है, लक्ष्य नहीं है। कम गुणवत्ता, असंपादित MT स्पैम है। मानवीकरण परत आपकी सुरक्षा है, और यह बेहतर कंटेंट भी तैयार करता है। दोनों चीजें सच हैं।

मुझे एक बार में कितनी भाषाएँ लॉन्च करनी चाहिए?

एक, शायद दो। मैंने देखा है कि लोग सात स्थानीयताओं को एक साथ लॉन्च करने का प्रयास करते हैं और सभी में माध्यमिक कंटेंट तैयार करते हैं। ट्रैफिक डेटा और मौजूदा माँग संकेतों के आधार पर अपने सर्वोच्च-अवसर बाजार को चुनें, इसे सही तरीके से करें, इससे सीखें, फिर विस्तार करें। Seahawk आमतौर पर एक चरणबद्ध रोलआउट की सिफारिश करता है: पहले वर्ष के लिए प्रति तिमाही एक स्थानीयता।

क्या मैं DeepL की जगह ChatGPT का उपयोग कर सकता हूँ?

हाँ, कुछ सावधानियों के साथ। व्यक्तित्व, रजिस्टर और टोन निर्देशों के साथ एक अच्छी तरह से इंजीनियर किया गया GPT-4o प्रॉम्प्ट कई भाषा जोड़ियों के लिए DeepL के साथ प्रतिस्पर्धी आउटपुट तैयार कर सकता है। यह अक्सर एशियाई भाषाओं के लिए बेहतर होता है। व्यापार-ऑफ स्थिरता है: TM टूलिंग के बिना इसके ऊपर बैठा हुआ, आप सत्रों में शब्दावली में भिन्नता देखेंगे। यूरोपीय भाषाओं के लिए DeepL का उपयोग करें जहाँ यह बेहतरीन है। ऐसी भाषाओं के लिए GPT-4o का उपयोग करें जहाँ DeepL की गुणवत्ता कमजोर है, प्रॉम्प्ट में सावधानीपूर्वक रखी गई शब्दावली के साथ।

स्थानीयकरण परियोजनाओं में सबसे बड़ी गलती क्या है?

इसे अनुवाद परियोजना के बजाय कंटेंट परियोजना के रूप में व्यवहार करना। अनुवाद सटीकता के बारे में है। कंटेंट प्रदर्शन के बारे में है। जिस क्षण आपका ब्रीफ केवल "क्या उन्होंने इसका सही अनुवाद किया?" पूछता है बजाय "क्या यह पृष्ठ ट्रैफिक कमाता है और आगंतुकों को परिवर्तित करता है?", परियोजना पहले से ही गलत दिशा में है।

---

यह पाइपलाइन जादू नहीं है। यह एक अनुक्रम है: मजबूत MT आधार, केंद्रित मानव संपादन, मूल कीवर्ड अनुसंधान, स्वच्छ तकनीकी कार्यान्वयन, धैर्यपूर्ण माप। प्रत्येक चरण छोड़ा जा सकता है। लेकिन हर चरण जो आप छोड़ते हैं वह लगभग तीन महीने बाद आपके GSC डेटा में दिखाई देता है, और तब तक आप पहले से ही बजट खर्च कर चुके होते हैं।

पहली बार इसे सही करें। यह सस्ता है।

← वापस