Blog

PDF से प्लेन टेक्स्ट कैसे निकालें — ChatGPT या कहीं भी पेस्ट करने के लिए

PDF से पेज-दर-पेज कॉपी-पेस्ट करने के बजाय टेक्स्ट एक्सट्रैक्ट करना क्यों बेहतर है, और यह कब चुपचाप फेल हो जाता है — इसका सही हल भी।

Also available in:EnglishHinglish

PDF से कॉपी-पेस्ट करना जितना आसान लगना चाहिए, उतना है नहीं

कई पेजों वाली PDF से एक-एक पेज करके टेक्स्ट सेलेक्ट करना, हर टुकड़े को कहीं पेस्ट करना, और साथ आने वाले अजीब लाइन-ब्रेक साफ करना — यह छोटा सा काम जरूरत से ज्यादा समय ले लेता है। आजकल यह इसलिए आम हो गया है क्योंकि डॉक्यूमेंट का कंटेंट किसी AI असिस्टेंट, ट्रांसलेशन टूल, या सर्च-एंड-रिप्लेस स्क्रिप्ट में पेस्ट करना एक रोज़मर्रा का काम बन गया है — आपको सिर्फ शब्द चाहिए, PDF का रैपर नहीं।

पेज-दर-पेज स्क्रॉल और सेलेक्ट करने के बजाय एक ही बार में सब कुछ निकालना, पंद्रह मिनट के काम को लगभग तुरंत बना देता है, और आपको एक साफ टेक्स्ट ब्लॉक देता है जिसे कहीं भी डाला जा सकता है।

यह PDF की असली टेक्स्ट लेयर पढ़ता है, तस्वीर नहीं

यह एक्सट्रैक्शन सीधे उसी इंटरनल टेक्स्ट डेटा से होता है जो किसी सामान्य व्यूअर में PDF के टेक्स्ट को सेलेक्ट और सर्च करने लायक बनाता है — यह स्ट्रक्चर्ड डेटा पढ़ रहा है, अक्षरों को विज़ुअली पहचानने की कोशिश नहीं कर रहा। यह उन मामलों में किसी भी इमेज-रिकग्निशन तरीके से तेज़ और ज्यादा सटीक होता है जहां फाइल में टेक्स्ट डेटा असल में मौजूद हो।

रीडिंग ऑर्डर आमतौर पर PDF के इंटरनल कंटेंट ऑर्डर के हिसाब से चलता है, जो सामान्य सिंगल-कॉलम डॉक्यूमेंट में विज़ुअल रीडिंग ऑर्डर से मेल खाता है — ज्यादातर रिपोर्ट, आर्टिकल और लेटर इसी श्रेणी में बिना किसी दिक्कत के आते हैं।

वह एक स्थिति जिसमें लोग फंस जाते हैं

फोटोकॉपी करके PDF बनाई गई हो, या फोन कैमरे से खींचा गया डॉक्यूमेंट PDF बनाकर सेव किया गया हो, तो देखने में यह बिल्कुल सामान्य लगती है लेकिन अक्सर इसमें कोई embedded टेक्स्ट नहीं होता — यह सिर्फ एक तस्वीर होती है, PDF की तरह पैक की गई। इसे टेक्स्ट एक्सट्रैक्टर से गुजारने पर कुछ नहीं मिलता, और यह कोई गड़बड़ी नहीं है — फाइल में पढ़ने के लिए असल में कोई टेक्स्ट डेटा है ही नहीं।

इस स्थिति में सही हल है एक खास OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) टूल, जो खासतौर पर इमेज के पिक्सल्स से अक्षर पहचानने के लिए बनाया गया है, न कि ऐसा टेक्स्ट डेटा पढ़ने के लिए जो शुरू से मौजूद ही नहीं था। यह मान लेने से पहले कि एक्सट्रैक्शन टूल खराब है, यह समझ लेना जरूरी है कि आप किस स्थिति में हैं।

जो जानबूझकर छोड़ दिया जाता है

आउटपुट जानबूझकर सिंपल रखा जाता है — कोई बोल्ड नहीं, कोई हेडिंग नहीं, कोई कॉलम नहीं, कोई फॉन्ट जानकारी नहीं, बस रीडिंग ऑर्डर में शब्द। चैट बॉक्स, स्क्रिप्ट, या ट्रांसलेशन टूल में पेस्ट करने के लिए यही सही तरीका है, जो फॉर्मेटिंग मार्कअप पर अटक सकते हैं। अगर बेसिक स्ट्रक्चर (हेडिंग को बॉडी टेक्स्ट से अलग रखना) चाहिए, तो PDF-to-Markdown या PDF-to-HTML कन्वर्जन उसे थोड़ा बेहतर बनाए रखता है, थोड़े मैसी आउटपुट की कीमत पर।

Try PDF to Text nowFree, runs in your browser — no sign-up.

Frequently asked questions