#!/bin/bash
set -e

WORKDIR=$(mktemp -d)
trap "rm -rf $WORKDIR" EXIT

INPUT="tests/resources/graph.pdf"
OUTPUT="$WORKDIR/output.pdf"

echo "tesseract langs: $(tesseract --list-langs 2>&1)"
echo "ocrmypdf version: $(ocrmypdf --version 2>&1)"
echo "ocrmypdf location: $(python3 -c 'import ocrmypdf; print(ocrmypdf.__file__)')"
echo "Running ocrmypdf on $INPUT ..."
ocrmypdf -v 1 --force-ocr -l eng "$INPUT" "$OUTPUT"

TEXT=$(pdftotext "$OUTPUT" -)

if echo "$TEXT" | grep -qi "percentage"; then
    echo "PASS: OCR text found in output PDF"
else
    echo "FAIL: expected OCR text not found in output PDF"
    echo "Extracted text: $TEXT"
    exit 1
fi
