extractor._text_quality_ok לא מזהה סדר-קריאה RTL משובש ב-PDF דיגיטלי #456
Reference in New Issue
Block a user
Delete Branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
What & Why
שכבת-טקסט born-digital עוברת את שער-האיכות אך סדר-הקריאה RTL משובש → OCR (Mistral/vision) לא מופעל, וסיכומים במורד-הזרם מסלפים את המקור. נצפה בערר 1043-02-26 (כתב תשובה הוועדה המקומית מטה יהודה, doc f5ad19e7). תוקן ידנית לתיק זה ע"י re-OCR (Gemini vision) + עדכון extracted_text + re-chunk. דרוש תיקון-שורש בפייפליין.
הקשר ופירוט
מיקום: mcp-server/src/legal_mcp/services/extractor.py — _text_quality_ok (~ל.93) ו-_extract_pdf (~ל.189). המדדים הנוכחיים (אורך-מילה ממוצע, single-char %, מילים/שורה, % עברית) לא תופסים RTL scrambled. הצעות: (1) היוריסטיקת סדר — יחס טוקנים הפוכים/שבורים, ריצוף מספרים מפוצל (למשל "137" מפוצל לשורות), מילים "דבוקות-הפוכות"; (2) fallback ל-vision OCR (Gemini — GOOGLE_GEMINI_API_KEY זמין מקומית) כשה-quality-gate גבולי; (3) דגל per-doc לאלץ OCR. לעבור דרך docs/spec (01-ingest) + PR + review; מקיים G1 (נרמול-במקור) ו-G2 (לא מסלול-OCR מקביל — לשלב במסלול הקיים). אין לבצע inline בהרצת-יו"ר.
Acceptance Criteria
הועבר מ-TaskMaster (tag
legal-ai, id 230, status היהpending) ב-2026-08-05. הפניות(#230)בהודעות-commit ישנות מתייחסות למזהה ה-TaskMaster, לא למספר ה-issue הזה.