आपके PDF में छुपा डेटा, जो आपको पता भी नहीं चलता
PDF मेटाडेटा हटाने का मतलब है उस छुपी परत को हटाना, जिसका पेज पर छपी सामग्री से कोई लेना-देना नहीं है — और अगर आपके दस्तावेज़ में फोटो हैं, तो उस परत में हर तस्वीर कहां ली गई, उसके सटीक GPS निर्देशांक भी हो सकते हैं। कोई स्कैन किया हुआ अनुबंध, प्रॉपर्टी लिस्टिंग या पोर्टफोलियो भेजते समय आप अनजाने में अपना घर का पता, कैमरे का सीरियल नंबर, अपना पूरा नाम, इस्तेमाल किया गया सॉफ्टवेयर और हर संपादन का टाइमस्टैम्प भी भेज सकते हैं। ये सब फाइल पढ़ते समय नहीं दिखता, लेकिन जिसे भी फाइल मिले, वह दो क्लिक में यह सब देख सकता है।
MiniPNG इसे जड़ से हटाता है — सिर्फ वही फील्ड नहीं, जो PDF रीडर दिखाता है, बल्कि वह डेटा भी जो एम्बेडेड इमेजेज़, डिज़ाइन ऐप के बचे-खुचे हिस्सों और फाइल की अपनी पहचान में छिपा होता है।
आपकी तस्वीरों के अंदर लोकेशन और कैमरा डेटा
यही वह हिस्सा है, जिसे लगभग हर दूसरा PDF मेटाडेटा टूल छोड़ देता है। PDF में डाली गई फोटो अपना EXIF ब्लॉक बनाए रखती है: GPS अक्षांश और देशांतर, कैमरा का ब्रांड और मॉडल, लेंस और सीरियल नंबर। डॉक्युमेंट की प्रॉपर्टीज़ साफ करने से इसका कुछ नहीं होता। हर एम्बेडेड फोटो को अलग-अलग साफ किया जाता है।
डॉक्युमेंट प्रॉपर्टीज़ और XMP रिकॉर्ड
शीर्षक, लेखक, विषय, कीवर्ड्स, फाइल बनाने वाला एप्लिकेशन, उसे तैयार करने वाली लाइब्रेरी, और निर्माण व संशोधन की तारीखें। आधुनिक PDF में एक दूसरा, और भी समृद्ध रिकॉर्ड होता है जिसे XMP कहते हैं, जो इन्हें डुप्लिकेट करता है और संपादन इतिहास भी जोड़ता है — और यह सिर्फ डॉक्युमेंट ही नहीं, बल्कि हर पेज और इमेज से भी जुड़ सकता है। यह सब जहां भी छिपा हो, उसे खोजकर हटाया जाता है।
डिज़ाइन और ऑफिस सॉफ्टवेयर के छोड़े गए निशान
Illustrator, InDesign और इसी तरह के टूल्स PDF के अंदर निजी ब्लॉक स्टोर करते हैं, जो उस वर्कस्टेशन का नाम भी बता सकते हैं, जिस पर फाइल बनाई गई थी। टिप्पणियों और एनोटेशन में लिखने वाले का नाम और टाइमस्टैम्प जुड़ा होता है। PDF के अंदर अटैच की गई फाइलें भी साथ चलती हैं। इनमें से हर एक को हटा दिया जाता है — हालांकि टिप्पणी का टेक्स्ट रखा जाता है, क्योंकि वह आपकी लिखी सामग्री है, पहचान नहीं।
वह पहचानकर्ता जो आपकी कॉपियों को जोड़ता है
हर PDF में पहचान के लिए दो पहचानकर्ता होते हैं, जो एक डॉक्युमेंट की एक कॉपी को दूसरी से जोड़ते हैं, और बाकी सब हटाने के बाद भी बने रहते हैं। एक नया पहचानकर्ता लिखा जाता है ताकि पुरानी और नई कॉपी का मेल न हो सके।
आपकी फाइल को फिर से बनाया जाता है, सिर्फ ऊपर से नहीं सुधारा जाता
यहीं पर ज्यादातर मेटाडेटा रिमूवर चुपचाप फेल हो जाते हैं। किसी फील्ड को सुधार जोड़कर साफ करने से असली वैल्यू फाइल में छुपी रह जाती है — PDF रीडर में अदृश्य, लेकिन किसी भी टेक्स्ट एडिटर में सेकंडों में पढ़ी जा सकती है। डॉक्युमेंट को जड़ से फिर से बनाया जाता है, ताकि पुरानी वैल्यू सचमुच मिट जाए।
इसके बाद जांच होती है। साफ की गई फाइल को फिर से खोलकर जांचा जाता है, फिर आपको दी जाती है। अगर कुछ भी बचा रह गया, तो काम फेल हो जाता है — आपको कभी भी ऐसा फाइल नहीं दी जाएगी, जिसे आप सुरक्षित मान लें।
क्या हटाया जाता है
- एम्बेडेड फोटो के अंदर GPS लोकेशन, कैमरा ब्रांड, मॉडल और सीरियल नंबर
- शीर्षक, लेखक, विषय, कीवर्ड्स, निर्माता और प्रोड्यूसर
- निर्माण और संशोधन की तारीखें
- XMP मेटाडेटा रिकॉर्ड, डॉक्युमेंट और ऑब्जेक्ट स्तर पर
- डिज़ाइन और पब्लिशिंग सॉफ्टवेयर के छोड़े गए निजी ब्लॉक
- टिप्पणी और एनोटेशन के लेखक का नाम और टाइमस्टैम्प
- PDF के अंदर अटैच की गई फाइलें
- डॉक्युमेंट पहचानकर्ता, जो कॉपियों को जोड़ता है
- मौजूदा पासवर्ड सुरक्षा, ताकि फाइल बाद में खुल सके
क्या नहीं हटाया जाता
- पेज पर दिखाई देने वाली कोई भी चीज़ — लेटरहेड पर छपा नाम छपा ही रहेगा
- आपकी टिप्पणियों का टेक्स्ट; सिर्फ उनसे जुड़ा नाम हटाया जाता है
अब आगे क्या?
कोई स्कैन किया हुआ दस्तावेज़ या पोर्टफोलियो साफ कर रहे हैं? फोटो मेटाडेटा हटाएं PDF बनाने से पहले ही स्टैंडअलोन इमेजेज़ से वही GPS और कैमरा डेटा हटा देता है। जब आपकी फाइल साफ हो जाए, तो PDF संपीड़ित करें उसे भेजने के लिए छोटा बना सकता है, और PDF जोड़ें उसे अन्य साफ की गई फाइलों के साथ मिला सकता है — हर स्रोत फाइल का मेटाडेटा एक ही तरह से हटाया जाता है।