< BACK एक खुली नोटबुक और पेन डेस्क के बीच में, पाँच चमकती लैपटॉप स्क्रीन्स से घिरा हुआ

एआई मॉडल्स खोलने से ज़्यादा खतरनाक क्यों बन जाते हैं (जब तक कि बेहतर नहीं हो जाते)

इंस्टिंक्ट यह है कि ज़्यादा मॉडल्स का मतलब बेहतर जवाब। एक और टैब, एक और नज़रिया, सच तक पहुँचने के लिए त्रिभुज बनाओ। यह तीन मॉडल्स तक काम करता है और फिर कड़ा उलटा हो जाता है। उससे आगे, हर मॉडल जो आप जोड़ते हो वह समझौते में जितना खर्च करता है उससे कहीं ज़्यादा है, और सबसे पहली चीज़ जो गिरती है वह आपकी रफ़्तार नहीं है। आपका फ़ैसला है कि कौन सा जवाब सही था।

मुख्य सीख: एक मॉडल साफ़ सोच के लिए मजबूर करता है। दो या तीन आपको एक असली दूसरी राय देते हैं। उससे आगे आप मॉडल्स को ऑर्केस्ट्रेट नहीं कर रहे हैं, आप एक ऐसी कमेटी की अध्यक्षता कर रहे हैं जो दस मिनट पहले की सहमति याद नहीं रख सकती।

मैंने यह कर्व एक महीने के बाद खींचा जब मेरे पास छः मॉडल्स लगभग हमेशा खुले थे, मुझे बेहद उत्पादक महसूस हुआ, और मैंने नोटिस से भी बदतर काम भेजा।

Hand-drawn chart titled Confidence vs Number of Models Open, showing quality rising from one model to a peak at three then falling steeply through four, five and six models, with the range one to two labelled sweet spot and three to six labelled chaos multiplier.
The honest version of my AI workflow, plotted. Peak is at three. Everything right of three is me negotiating with myself.

छः मॉडल्स खुले होने से मुझे एक रीडायरेक्ट मैप पर एक दिन का नुक़सान हुआ

मेरे सबसे बुरे समय में मेरे पास Opus 5 एक आर्किटेक्चर समस्या पर था, Codex कार्यान्वयन के बीच आधा रास्ता पर था, Composer एडिटर में लाइव था, Grok दूसरी बार पढ़ने के लिए खुला था, और Qwen और Kimi दो और टैब्स में पार्क थे क्योंकि X पर किसी ने कहा कि वे इस काम में अच्छे हैं। यह कॉकपिट लगा। यह एक ग्रुप चैट था जहाँ किसी ने ब्रीफ़ पढ़ी ही नहीं थी।

यह खर्च एक रीडायरेक्ट मैप में दिखा। मैं एक बड़ी प्रोग्रामैटिक साइट पर कुछ सौ पुरानी URLs को कंसोलिडेट कर रहा था — उस तरह का काम जहाँ 95 प्रतिशत सही होना एक आपदा है क्योंकि बाकी 5 प्रतिशत चुपचाप राजस्व को 301 के जरिए एक दीवार में भेज रहा है। मैंने तीन मॉडल्स से पूछा और ट्रेलिंग-स्लैश चेन के बारे में तीन दिखाऊ जवाब पाए। एक को चुनने और उसके जरिए तर्क देने की जगह, मैंने उन्हें मर्ज कर दिया। यह मिश्रण तीनों में से किसी से भी बदतर था, क्योंकि हरेक अपने आप में सुसंगत था और मर्ज नहीं था। एक दिन इसे सुलझाने में लगा, पूरी तरह अपनी गलती।

एक मॉडल आपको स्पष्ट रूप से सोचने के लिए मजबूर करता है

एक मॉडल की कम आंकी गई खूबी यह है कि यह स्पेक को वापस आपके पास डालता है। बिल्कुल एक ही चीज पूछने के साथ, आपको एक असली ब्रीफ लिखना होता है: इनपुट, आउटपुट को क्या संतुष्ट करना चाहिए, स्कोप में क्या नहीं है, "डन" का मतलब क्या है। लिखने का यह काम ज्यादातर इंजीनियरिंग है। मैंने प्रॉम्प्ट लिखते हुए जितनी डिजाइन गलतियाँ पकड़ी हैं, किसी भी कोड रिव्यू में नहीं।

छः मॉडल्स खुले हों तो यह अनुशासन चुपचाप गायब हो जाता है। आप ब्रीफ लिखना बंद कर देते हैं और पोल लेना शुरू करते हैं, और एक अस्पष्ट सवाल छः मॉडल्स को दाग देता है जो छः आत्मविश्वास से भरे जवाब देते हैं। आत्मविश्वास साक्ष्य नहीं है, यह बस इसी तरह की चीजें ध्वनि करती हैं। मेरे Claude Code वर्कफ़्लो में लगभग सभी मूल्य मॉडल के ऊपर की ओर बैठता है।

दो या तीन मॉडल्स असली मीठा स्थान हैं

तीन काम करता है इसका कारण यह है कि मॉडल्स एक ही काम समानांतर में नहीं, बल्कि अलग-अलग काम कर रहे हैं। श्रम विभाजन योगात्मक है। डुप्लिकेशन नहीं। एक मॉडल योजना रखता है, एक कोड लिखता है, एक इसे आपको ठंडे तरीके से पढ़ता है। कोई वोटिंग नहीं कर रहा।

जिस पल दो मॉडल्स एक ही काम कर रहे हों, आपने रिडंडेंसी नहीं खरीदी है। आपने एक टाई-ब्रेक खरीदा है जिसे सिर्फ आप ही सुलझा सकते हैं, और आप बातचीत में सबसे कम आराम वाले प्रतिभागी हैं।

जब एक स्पेशलिस्ट मॉडल वाकई अपना टैब कमाता है

स्पेशलिस्ट्स लायक हैं जब वे संरचनात्मक रूप से अलग हों, सिर्फ अलग-अलग ब्रांडेड नहीं। मेरा परीक्षण सरल है: क्या यह दूसरों से इस तरह असहमत है कि मैं इससे सीख सकूँ? एक मॉडल जो सब चीजों से सहमत है वह एक बहुत ही महंगा हामीदार है।

Codex इमप्लीमेंटेशन पर अपना टैब कमाता है, विशेष रूप से कई फाइलों में लंबे यांत्रिक बदलाव जहाँ मैं एक बातचीत की जगह एक डिफ चाहता हूँ। Composer 2.5 एडिटर के अंदर इसे कमाता है, जहाँ मूल्य लेटेंसी में है, गहराई में नहीं। Grok प्रोडक्ट और पोजिशनिंग सवालों पर इसे कमाता है, क्योंकि यह मुझे खुशी से बताता है कि विचार उबाऊ है। Qwen और Kimi इसे तब कमाते हैं जब मैं एक ही इलाके से एक और वोट की जगह एक अलग ट्रेनिंग डिस्ट्रिब्यूशन चाहता हूँ। मेरे पास Kimi एक यूआई-ऑडिट स्क्रिप्ट में वायर्ड है बिल्कुल इसलिए क्योंकि यह उन चीजों को नोटिस करता है जो दूसरों ने विनम्र होना सीख लिया है।

यह आखिरी अंतर ही पूरा खेल है। ज्यादातर समय जब लोग पाँचवाँ मॉडल जोड़ते हैं तो वे किसी और राय की तलाश नहीं कर रहे, वे किसी और पुष्टि की तलाश कर रहे हैं। ये पल भर में एक जैसे लगते हैं और वे विपरीत होते हैं।

छिपी हुई कीमत स्विचिंग नहीं, समन्वय है।

कॉन्टेक्स्ट स्विचिंग वह कीमत है जिसका नाम सब लेते हैं, और वह वास्तविक है: आप उसी फ़ाइल को चौथी बार पढ़ते हैं क्योंकि आप नहीं याद रख पाते कि आपने किस टैब को बाधा के बारे में बताया था। लेकिन यह महंगी नहीं है।

महंगी वह है कि आप ही मर्ज कॉन्फ्लिक्ट बन जाते हैं। दो मॉडल आपको एक असहमति देते हैं जिसका फैसला करना है। तीन आपको तीन देते हैं। छह आपको पंद्रह जोड़ी असहमति देते हैं, और हर एक को उसी थके हुए इंसान के फैसले की जरूरत है। आपके स्टैक में कोई भी वह समन्वय नहीं कर रहा। आप इंटीग्रेशन लेयर हैं, दिन के अंत में चल रहे हैं, एक ऐसी समस्या पर जिसकी छह अलग-अलग फ्रेमिंग आप पढ़ चुके हैं।

और मॉडल यहाँ आपकी मदद नहीं कर सकते, क्योंकि कोई भी नहीं जानता कि दूसरों ने क्या कहा। आप ही हैं जो पूरा कॉन्टेक्स्ट रखे हुए हैं, जो बिल्कुल वही स्थिति है जिससे आप बाहर निकलने की कोशिश कर रहे थे।

AI ऑर्केस्ट्रेशन आमतौर पर एक मानवीय समस्या है।

जब लोग कहते हैं कि उन्हें बेहतर ऑर्केस्ट्रेशन की जरूरत है, तो वे आमतौर पर एक स्पष्ट ब्रीफ की जरूरत का मतलब रखते हैं। अगर तीन मॉडल आपको तीन सच में अलग-अलग जवाब देते हैं, तो यह शायद ही कभी क्षमता की कमी है। यह लगभग हमेशा सवाल में अस्पष्टता है, और कोई भी रूटिंग लॉजिक एक अधूरी समस्या को ठीक नहीं करता। यह बस उसे वितरित करता है।

जो डायग्नोस्टिक मैं अब इस्तेमाल करता हूँ: अगर मैं दो वाक्यों में यह नहीं लिख सकता कि एक सही जवाब को क्या संतुष्ट करना होगा, तो किसी और मॉडल को खोलना प्रगति पट्टी के साथ टालमटोल है। पहले दो वाक्य लिखो। कभी-कभी दो वाक्य ही जवाब होते हैं और मैं हर टैब बंद कर देता हूँ।

वह वर्कफ़्लो जो मैं आज असल में चलाता हूँ।

Opus 5 सोचने के लिए। आर्किटेक्चर, ट्रेडऑफ़्स, वह अजीब सवाल कि चीज़ को बनाया भी जाना चाहिए या नहीं। यह वह जगह है जहाँ मैं प्रॉम्प्ट में प्रयास लगाता हूँ, क्योंकि यहाँ गलत फैसला बाद में बेहतर कोड से ठीक नहीं किया जा सकता।

कार्यान्वयन के लिए कोडेक्स। एक बार आकार तय हो जाए, तो उसे विनिर्देश दे दो और काम करने दो। मैं तर्क नहीं, diff की समीक्षा करता हूँ।

कोडिंग सहायता के लिए Composer 2.5। एडिटर में, तेज़, छोटे दायरे वाला। यह बेहतर ऑटोकंप्लीट है, सहकर्मी नहीं, और इसे सहकर्मी मानना ही है जो आपको 400 लाइनें देता है जो आपने माँगी नहीं थीं।

वैकल्पिक दृष्टिकोण के लिए Grok। जानबूझकर महत्वपूर्ण पथ पर नहीं। मैं वहाँ जाता हूँ जब मुझे संदेह होता है कि मैंने अपने आप को किसी चीज़ में फँसा लिया है।

जब मुझे एक और राय चाहिए, एक और पुष्टि नहीं, तो Qwen या Kimi। शायद ही कभी। जानबूझकर।

जो बात मायने रखती है वह सूची नहीं है। यह है कि ये लगभग कभी एक साथ खुली नहीं होती हैं। एक कॉकपिट नहीं, एक क्रम: सोचना, फिर कार्यान्वयन, फिर समीक्षा—प्रत्येक चरण में एक मॉडल कलम पकड़े रहता है। चार्ट तीन पर शिखर पर है क्योंकि एक अच्छे दिन में तीन ही वास्तव में सक्रिय चरण होते हैं। मैंने Claude Code बनाम Cursor में इन दोनों की तुलना की।

बेहतर प्रॉम्प्ट अधिक टैब को हराते हैं।

एक अच्छी तरह से निर्दिष्ट समस्या एक अच्छे मॉडल को दी गई है छः को एक अस्पष्ट समस्या से बेहतर है, और यह करीब नहीं है। अधिक मॉडल बेहतर लगते हैं क्योंकि टैब खोलना तत्काल है और ब्रीफ लिखना काम है। AI FOMO यह विश्वास है कि अगला मॉडल उस सोच को करेगा जो आप टाल रहे हैं। यह नहीं करेगा। यह गलत समस्या के बारे में अधिक स्पष्ट होगा।

अनुशासन बेरंग है और यह चक्रवृद्धि है। जो लोग मैं जानता हूँ इन उपकरणों के साथ सबसे अच्छा काम कर रहे हैं वे सबसे अधिक मॉडल नहीं चला रहे हैं। वे दो या तीन चला रहे हैं, जानबूझकर, स्पष्ट श्रम विभाजन और लिखित विनिर्देश के साथ, और वे मॉडल-ऑफ़-द-वीक प्रवचन से ऊब गए हैं।

आज के लिए एक काम।

एक को छोड़कर सभी AI टैब बंद करो। जिस काम पर तुम हो उसे लो और दो वाक्य लिखो: इनपुट क्या है, और सही आउटपुट को क्या संतुष्ट करना होगा। वे दो वाक्य उस एक मॉडल को दो जो तुमने खुला रखा है। अगर जवाब अच्छा है, तो तुम्हारी बाधा कभी मॉडल क्षमता नहीं थी। अगर यह बुरा है, तो अब तुम जानते हो कि दोनों में से कौन सा वाक्य गलत था, जो छः मॉडल तुम्हें नहीं बता सकते थे।

FAQ

मुझे एक बार में कितने AI मॉडल का उपयोग करना चाहिए?

दो या तीन, अलग-अलग काम करने के लिए: एक समस्या को सोचने-समझने के लिए, एक को लागू करने के लिए, और वैकल्पिक रूप से एक समीक्षा करने या विरोधाभासी दृष्टिकोण देने के लिए। तीन से अधिक होने पर, परस्पर विरोधी उत्तरों को सुलझाने की लागत अतिरिक्त दृष्टिकोण के मूल्य से तेजी से बढ़ती है, क्योंकि आप ही एकमात्र ऐसा व्यक्ति हैं जो जानता है कि उन सभी ने क्या कहा।

क्या एक ही काम के लिए कई AI मॉडल का उपयोग करना बुरा है?

एक समान काम पर दो मॉडल चलाना आमतौर पर बर्बादी है। यह अनावश्यकता नहीं खरीदता, यह एक टाई-ब्रेकर खरीदता है जिसे सिर्फ आप ही हल कर सकते हैं। कई मॉडल तब मदद करते हैं जब उनके अलग-अलग भूमिकाएँ हों, जैसे योजना बनाना बनाम कार्यान्वयन, और जब वे एक-दूसरे को दोहराते हैं तब नुकसान पहुंचाते हैं।

AI मॉडल के बीच स्विच करने की वास्तविक लागत क्या है?

स्पष्ट लागत संदर्भ फिर से स्थापित करना और एक ही फाइलें फिर से पढ़ना है। बड़ी लागत समन्वय है: छह मॉडल के साथ आपके पास पंद्रह युग्मित असहमतियाँ हैं जिन्हें आपको तय करना है, और आपके स्टैक में इसके लिए कुछ भी नहीं है। आप ही एकीकरण परत बन जाते हैं।

क्या Codex, Grok, Qwen या Kimi जैसे विशेषज्ञ मॉडल वास्तव में मदद करते हैं?

हाँ, जब वे केवल अलग-अलग ब्रांडेड नहीं बल्कि संरचनात्मक रूप से भिन्न हों, और जब उनके पास एक परिभाषित भूमिका हो। परीक्षा यह है कि क्या मॉडल आपके अन्य मॉडल से इस तरह असहमत है जिससे आप कुछ सीख सकें। अगर यह ज्यादातर सहमत है, तो आप पुष्टि के लिए भुगतान कर रहे हैं, अंतर्दृष्टि के लिए नहीं।

संबंधित: मेरा Claude Code वर्कफ़्लो एकल-मॉडल अनुशासन के लिए जिसे यह तर्क देता है, और एक Claude Code डेवलपर को काम पर रखना अगर आप चाहते हैं कि यह किसी और की समस्या हो।

< BACK