AI लेखन उपकरणों का परीक्षण: 8 को डिटेक्शन सॉफ़्टवेयर के विरुद्ध रैंक किया गया
पिछले महीने मैंने सबसे लोकप्रिय AI लेखन सहायकों में से आठ को तीन मुख्यधारा डिटेक्शन प्लेटफ़ॉर्म्स — GPTZero, Originality.ai, और Copyleaks — पर एक जैसी 800-शब्दों की ब्रीफ़्स का उपयोग करके चलाया। नतीजे मार्केटिंग पेजों में किए गए दावों से कम अनुमानित थे: सबसे महंगा विकल्प सबसे "मानवीय" नहीं था, और एक मुफ़्त टूल ने हर उस डिटेक्टर पर लगातार भुगतान वाले प्रतिस्पर्धियों को पीछे छोड़ दिया जिसे मैंने उस पर आज़माया। अगर आप आज एक AI लेखक चुन रहे हैं, तो आपका निर्णय टूल पर कम और इस पर ज़्यादा निर्भर होना चाहिए कि जनरेशन के बाद आप आउटपुट का उपयोग कैसे करेंगे।
ट्विटर पर कोई यह स्वीकार नहीं करना चाहता, लेकिन बात यह है: AI डिटेक्शन सॉफ़्टवेयर अविश्वसनीय है, और इसे बनाने वाले लोग यह खुलकर कहते हैं। GPTZero का अपना डॉक्यूमेंटेशन मानव-लिखित टेक्स्ट पर 2% से अधिक फ़ॉल्स-पॉज़िटिव दर को स्वीकार करता है। Originality की सीमा एक स्लाइडर है जिसे आपको खुद सेट करना होता है। इसलिए जब एक ही आउटपुट के साथ कोई टूल Detector A पर "98% human" और Detector B पर "12% human" स्कोर करता है, तो असली सवाल यह नहीं है कि कौन-सा AI लेखक जीतता है — बल्कि यह है कि कौन-सा वर्कफ़्लो ऐसा टेक्स्ट पैदा करता है जिसे आप वास्तव में प्रकाशित करेंगे, बिना फ़्लैग हुए, बिना उजागर हुए, या Google द्वारा चुपचाप नीचे रैंक किए गए।
आठों टूल तीन स्तरों में बँट गए। टियर एक (Surfer AI, Koala) ने ऐसा गद्य तैयार किया जो लगातार तीनों डिटेक्टरों से पास हो गया, लेकिन पढ़ने में बिल्कुल वैसा लगा — सक्षम SEO फ़िलर, जिसमें हर बार वही शुरुआती लय थी। टियर दो (Jasper, Copy.ai, Writesonic) 60–80% "likely human" की रेंज में थे और मूल जैसा महसूस कराने के लिए उन्हें वास्तविक संपादन की ज़रूरत थी। टियर तीन (डिफ़ॉल्ट सेटिंग्स के साथ ChatGPT, कच्चा Claude, कच्चा Gemini) मेरी हर टेस्ट में कम से कम एक डिटेक्टर पर AI के रूप में फ़्लैग हुए, अक्सर दो पर। आठों में से किसी ने भी ऐसा टेक्स्ट नहीं बनाया जो किसी कुशल मानव लेखक से भेदहीन हो, बिना कम-से-कम इन तीन हस्तक्षेपों में से एक के: शुरुआती पैराग्राफ़ को फिर से लिखना, विशिष्ट जीवनानुभव जोड़ना, या टूल की पसंदीदा पैराग्राफ़ लय को तोड़ना।
सबसे बड़ा वेरिएबल टूल नहीं था — प्रॉम्प्ट था। "ईमेल मार्केटिंग पर 500-शब्दों का ब्लॉग इंट्रो" माँगने पर हर बार फ़्लैग किया गया आउटपुट मिला। "ईमेल मार्केटिंग पर एक bootstrap SaaS founder का विरोधी दृष्टिकोण, जो ऑटोमेशन से नफ़रत करता है, छोटे और दमदार वाक्यों में लिखा गया" माँगने पर डिटेक्टर पास हुए और पढ़ने में बेहतर लगा। विशिष्टता दो बार जीतती है।
अगर आप इस हफ़्ते कोई टूल चुन रहे हैं, तो डिटेक्टर स्कोर के बजाय एडिटर अनुभव के आधार पर चुनें। टियर-एक टूल आपको सबसे ज़्यादा सफ़ाई का समय बचाते हैं, और यही असली बाधा है। फिर अपनी आवाज़ में इंट्रो को फिर से लिखने में दस मिनट लगाएँ — वही हिस्सा है जिसे पाठक (और डिटेक्शन मॉडल) सबसे पहले नोटिस करते हैं।
आज दोपहर एक ही विषय पर, जिसे आप अच्छी तरह जानते हैं, दो टूल्स के बीच एक ब्रीफ़ आज़माएँ। डिटेक्टर स्कोर की तुलना करें, फिर यह भी तुलना करें कि अपने नाम से उसे प्रकाशित करने से पहले हर ड्राफ़्ट को कितनी संपादन की ज़रूरत पड़ती है। यही असली बेंचमार्क है जिसका मार्केटिंग कॉपी कभी ज़िक्र नहीं करती।
