OCR PDF: स्कैन की हुई PDF को सर्च करने लायक बनाएँ
स्कैन की हुई PDF डालें: हर पेज कैरेक्टर रिकग्निशन से पढ़ा जाता है, और मिला हुआ टेक्स्ट इमेज के नीचे अदृश्य रूप से जोड़ दिया जाता है। फिर आप कोई शब्द सर्च कर सकते हैं, सेलेक्ट और कॉपी कर सकते हैं, और डॉक्यूमेंट दिखने में बिल्कुल नहीं बदलता।
- मुफ़्त
- 15 भाषाएँ
- मूल इमेज वैसी ही
- आपके डिवाइस पर प्रोसेस
100% प्राइवेट — सब कुछ सीधे आपके ब्राउज़र में प्रोसेस होता है: आपकी फाइलें, आपकी आवाज़ और आपकी तस्वीर कभी भी Chatzam के सर्वर पर नहीं भेजी जातीं।
PDF का OCR कैसे करें?
-
स्कैन की हुई PDF डालें
टूल तुरंत पहचान लेता है कि कौन-से पेज सिर्फ़ इमेज हैं और किनमें पहले से टेक्स्ट है।
-
भाषाएँ चुनें
हिंदी डिफ़ॉल्ट रूप से चुनी रहती है; अगर डॉक्यूमेंट में कई भाषाएँ मिली हुई हैं, तो अंग्रेज़ी या कोई दूसरी भाषा जोड़ें।
-
सर्च होने वाली PDF डाउनलोड करें
पेज-दर-पेज प्रोग्रेस देखें, फिर PDF लें, और ज़रूरत हो तो सादा टेक्स्ट .txt में भी।
ऐसा स्कैन जो असली PDF की तरह काम करे
अदृश्य टेक्स्ट, हर शब्द अपनी जगह
पहचाना गया हर शब्द ठीक अपनी इमेज पर रखा जाता है: सर्च और सेलेक्शन सही जगह पर होते हैं।
क्वालिटी में कोई कमी नहीं
पेजों की इमेज न दोबारा कंप्रेस होती हैं, न उनका साइज़ बदलता है; जिन पेजों में पहले से टेक्स्ट है, वे नहीं बदले जाते।
टेढ़े पेज सीधे किए जाते हैं
आड़ा या उल्टा स्कैन हुआ पेज पहचाना जाता है और पढ़ने से पहले सीधा कर दिया जाता है।
एक साथ कई भाषाएँ
15 में से 5 भाषाएँ तक, जिनमें हिंदी, अंग्रेज़ी, अरबी, स्पेनिश, फ़्रेंच और जर्मन शामिल हैं।
PDF का OCR क्या है?
स्कैनर या स्कैनिंग ऐप से बनी PDF में सिर्फ़ पेजों की फ़ोटो होती हैं: आपको शब्द दिखते हैं, लेकिन सॉफ़्टवेयर को सिर्फ़ पिक्सल दिखते हैं। तब Ctrl+F से कोई नाम सर्च करना, कोई पैराग्राफ़ कॉपी करना या डॉक्यूमेंट को टेक्स्ट-टू-स्पीच सॉफ़्टवेयर से सुनना मुमकिन नहीं होता। OCR, यानी ऑप्टिकल कैरेक्टर रिकग्निशन, इमेज को एनालाइज़ करके उसमें मौजूद अक्षर पहचानता है। फिर यह टूल उस टेक्स्ट को PDF में एक अदृश्य लेयर के रूप में रखता है, हर शब्द के ठीक ऊपर। डॉक्यूमेंट दिखने में बिल्कुल वैसा ही रहता है, लेकिन सर्च, सेलेक्ट और इंडेक्स होने लायक बन जाता है, जैसे सीधे किसी वर्ड प्रोसेसर से बनी PDF।
सबसे अच्छा नतीजा कैसे पाएँ?
पहचान की क्वालिटी सबसे पहले स्कैन पर निर्भर करती है। 300 dpi पर, अच्छी रोशनी में, ब्लैक एंड व्हाइट या ग्रेस्केल में किया गया स्कैन छपे हुए टेक्स्ट पर बेहतरीन नतीजे देता है। पेज लगभग 300 dpi पर पढ़े जाते हैं, इसलिए हल्के स्कैन के साथ भी गुंजाइश रहती है। डॉक्यूमेंट में मौजूद सभी भाषाएँ चुनें: हिंदी और अंग्रेज़ी वाले फ़ॉर्म या नोटिस के लिए दोनों जोड़ें, वरना दूसरी भाषा के शब्द ठीक से नहीं पहचाने जाते। हाथ की लिखावट, मोहर और बहुत भरे बैकग्राउंड पर टेक्स्ट अब भी मुश्किल रहते हैं। OCR के बाद एक टेस्ट करें: डॉक्यूमेंट का कोई कम इस्तेमाल होने वाला शब्द सर्च करके देखें कि वह मिलता है या नहीं।
आपके डॉक्यूमेंट आपके डिवाइस पर ही रहते हैं
स्कैन की हुई PDF में अक्सर संवेदनशील कागज़ात होते हैं: पहचान पत्र, सैलरी स्लिप, कॉन्ट्रैक्ट, डॉक्टर के पर्चे। यहाँ फ़ाइल सीधे आपके ब्राउज़र में खोली और पढ़ी जाती है; वह कभी किसी सर्वर पर नहीं भेजी जाती। सिर्फ़ भाषा मॉडल, हर भाषा के कुछ मेगाबाइट, पहली बार इस्तेमाल पर डाउनलोड होते हैं और फिर ब्राउज़र के कैश में रहते हैं। डिवाइस की ताकत के हिसाब से प्रोसेसिंग में हर पेज पर कुछ सेकंड से लेकर लगभग बीस सेकंड लगते हैं; आप इसे कभी भी रद्द कर सकते हैं। PDF सर्च होने लायक बन जाने के बाद, आप दूसरे PDF टूल से उसे कंप्रेस कर सकते हैं, Word में बदल सकते हैं या उसका टेक्स्ट निकाल सकते हैं।
अक्सर पूछे जाने वाले सवाल
स्कैन की हुई PDF को एडिट करने लायक कैसे बनाएँ?
OCR पहचाना गया टेक्स्ट PDF में जोड़ता है: तब आप उसे सर्च, सेलेक्ट और कॉपी कर सकते हैं। कंटेंट में बदलाव करने के लिए, सर्च होने वाली PDF को « PDF से Word » से बदलें या टेक्स्ट को .txt में एक्सपोर्ट करें।
क्या मेरी PDF किसी सर्वर पर भेजी जाती है?
नहीं। PDF पूरी तरह आपके ब्राउज़र में पढ़ी और प्रोसेस की जाती है। सिर्फ़ भाषा मॉडल पहली बार डाउनलोड होते हैं, फिर कैश में रहते हैं।
क्या नई PDF भारी या कम क्वालिटी की होती है?
मूल इमेज बिना दोबारा कंप्रेस किए वैसी ही रखी जाती हैं। फ़ाइल सिर्फ़ जोड़े गए टेक्स्ट जितनी बढ़ती है, आम तौर पर कुछ दसियों किलोबाइट।
जिन पेजों में पहले से टेक्स्ट है, उनका क्या होता है?
वे पहचाने जाते हैं और बिना बदले छोड़ दिए जाते हैं। सिर्फ़ वे पेज कैरेक्टर रिकग्निशन से गुज़रते हैं जो केवल इमेज हैं।
क्या टूल हाथ की लिखावट पहचानता है?
यह छपे या टाइप किए हुए टेक्स्ट के लिए बना है। बहुत साफ़ हाथ की लिखावट कुछ हद तक पहचानी जा सकती है, लेकिन नतीजा भरोसेमंद नहीं होता।