scan, split, OCR, prepare for LLM
Você não pode selecionar mais de 25 tópicos Os tópicos devem começar com uma letra ou um número, podem incluir traços ('-') e podem ter até 35 caracteres.

models.py 420B

1234567891011121314151617181920
  1. from __future__ import annotations
  2. from dataclasses import dataclass, field
  3. from typing import Any
  4. @dataclass
  5. class ParsedBlock:
  6. label: str
  7. content: str
  8. bbox: tuple[int, int, int, int]
  9. confidence: float = 0.9
  10. @dataclass
  11. class OcrPageResult:
  12. blocks: list[ParsedBlock] = field(default_factory=list)
  13. raw_json: dict[str, Any] = field(default_factory=dict)
  14. width: int = 0
  15. height: int = 0