2026-07-23
لماذا تُلصق بعض ملفات PDF بشكل مثالي في Excel وأخرى لا
الأمر لا يتعلق بمدى نظافة شكل الملف. بل بما هو موجود فعلاً بداخله.
قد يبدو ملفا PDF متطابقين على الشاشة، لكنهما يتصرفان بشكل مختلف تماماً عند محاولة استخراج جدول منهما. الفرق ليس في الجودة البصرية — بل في ما إذا كان الملف يحتوي على طبقة نص حقيقية تحت التنسيق، أم أنه مجرد صورة للنص.
ملفات PDF ذات طبقة نص مقابل الملفات الممسوحة ضوئياً
ملف PDF ذو طبقة نص يُنشأ مباشرة من برنامج مثل Excel أو Word أو نظام محاسبي — النص الذي تراه نص حقيقي وقابل للتحديد وله بنية أساسية. أما ملف PDF الممسوح ضوئياً فهو صورة أو مسح ضوئي لمستند ورقي مسطّح في صورة واحدة؛ لا يوجد نص للتحديد، فقط بكسلات تشبه الحروف.
يمكنك معرفة أي نوع لديك باختبار واحد: افتح الملف وحاول تحديد بضع كلمات بالماوس. إذا تم تمييز نص حقيقي ونسخه، فهو ملف ذو طبقة نص. إذا لم يتم تحديد شيء، أو ظهر مربع مصمت بدلاً من النص، فهو صورة.
لماذا يهم هذا في الاستخراج
أداة PDF to Excel في RowMint تقرأ طبقة النص الفعلية ومواضع أعمدتها لإعادة بناء الجدول — تعمل بالكامل داخل متصفحك ولا ترفع الملف إلى أي مكان أبداً. هذا يعمل فقط لأن هناك نصاً حقيقياً للقراءة. أعطها ملفاً ممسوحاً ضوئياً ولن يكون هناك شيء لاستخراجه.
أما بالنسبة للمستندات الممسوحة ضوئياً أو المصوّرة، فتتبع أداة Scanned PDF to Excel نهجاً مختلفاً تماماً: ترسل صورة كل صفحة إلى نموذج OCR يقرأ البكسلات ويعيد بناء النص قبل أن تحاول RowMint بناء جدول منه. هذه عملية مختلفة جوهرياً — وأبطأ وأقل يقيناً — من قراءة طبقة نص موجودة فعلاً.
ما الذي قد يُعطّل حتى ملف PDF ذا طبقة نص
التنسيقات متعددة الأعمدة، والخلايا المدمجة التي تظهر كنص متداخل، والجداول بلا خطوط شبكة ظاهرة، كل ذلك قد يربك إعادة بناء الأعمدة حتى عندما يكون النص نفسه حقيقياً. إذا خرج الجدول بأعمدة مدمجة أو مقسّمة بشكل غريب، تحقق مما إذا كان الأصل يحتوي على تباعد أو محاذاة غير معتادة بدلاً من افتراض أن الأداة فشلت تماماً.
الأدوات المستخدمة في هذا الدليل
الأسئلة الشائعة
كيف أعرف قبل الرفع ما إذا كان ملف PDF لديّ سيتحوّل بسلاسة؟
جرّب تحديد نص في عارض PDF أولاً. إذا استطعت تمييز كلمات حقيقية ونسخها، فيجب أن تعمل أداة PDF to Excel. إذا لم يتم تحديد شيء، استخدم Scanned PDF to Excel بدلاً منها.
هل يمكنني استخدام Scanned PDF to Excel على ملف PDF عادي ذي طبقة نص؟
يمكنك ذلك، لكن لا داعي — فهو أبطأ ويُدخل OCR نسبة خطأ صغيرة لا توجد في القراءة المباشرة لطبقة النص. استخدم PDF to Excel كلما كان النص قابلاً للتحديد.
هل ترفع أي من الأداتين ملفي إلى خادم؟
تعمل PDF to Excel بالكامل داخل متصفحك — الملف لا يغادر جهازك أبداً. أما Scanned PDF to Excel فيجب أن ترسل صور الصفحات إلى مزوّد OCR لقراءتها، لأنه لا يوجد نص لاستخراجه محلياً؛ راجع صفحة الخصوصية لتفاصيل ما يُرسَل.