Spaces:
Paused
Paused
Download src/readers/pdf.py from CGIAR/PERI-AI-dev: direct link, hf CLI and curl.
- Browser
- Download file 494 Bytes
-
https://huggingface.co/spaces/CGIAR/PERI-AI-dev/resolve/main/src/readers/pdf.py
- Command line
-
hf download hf://spaces/CGIAR/PERI-AI-dev/src/readers/pdf.py
-
curl -L -o pdf.py https://huggingface.co/spaces/CGIAR/PERI-AI-dev/resolve/main/src/readers/pdf.py
494 Bytes
| """Reader for PDF files.""" | |
| def read_pdf(file_path: str) -> list[dict]: | |
| try: | |
| from pypdf import PdfReader | |
| reader = PdfReader(file_path) | |
| pages = [] | |
| for i, page in enumerate(reader.pages): | |
| text = page.extract_text() | |
| if text and text.strip(): | |
| pages.append({"page": i + 1, "text": text.strip()}) | |
| return pages | |
| except Exception as e: | |
| print(f"Warning: Could not read {file_path}: {e}") | |
| return [] | |