✅ Структура документа (layout) определяется качественно.
✅ Порядок чтения блоков в целом корректный.
✅ Таблицы извлекаются хорошо.
✅ Display-формулы (отдельные блочные формулы) успешно выделяются и экспортируются в LaTeX.
Например:
A_{i}=Z\cdot r+u_{i}\cdot\sqrt{1-R}
является корректным LaTeX и без проблем отображается в MathJax/KaTeX.
Это самая серьёзная проблема текущего pipeline.
Формулы вида
u_i ~ N(0,1)
R = r²
r = corr(...)
не выделяются как математические выражения.
Вместо этого они становятся частью обычного текста.
Именно это является причиной большинства последующих ошибок.
В результате появляются конструкции вида
\$R=r\^{}\{2\}\$
\textbackslash{}sim
\textbackslash{}mathrm
A\_i
Это уже невалидный LaTeX.
MathJax здесь не является причиной проблемы — он получает уже повреждённый текст.
Необходимо полностью исключить появление:
\$
\_
\textbackslash{}
если они являются результатом сериализации LaTeX.
Markdown должен содержать настоящий LaTeX, а не его текстовое представление.
Например
V a R
вместо
VaR
P D
вместо
PD
vhere
вместо
where
ndividual
вместо
Individual
Это снижает качество итогового документа.
Inline-математика должна сохраняться как
$u_i \sim N(0,1)$
а не как текст
\$u\_\{i\}\textbackslash{}sim...
Запрещается преобразовывать
\sqrt
\frac
\alpha
\sim
\mathrm
в
\textbackslash{}sqrt
\textbackslash{}frac
...
LaTeX, полученный от PP-StructureV3, должен использоваться без модификации.
Формат вывода:
$$
...
$$
Исправлять наиболее типичные ошибки OCR.
Например:
| Было | Должно стать |
|---|---|
V a R |
VaR |
P D |
PD |
N ^ {-1} |
N^{-1} |
l → 1 |
при высокой уверенности |
O → 0 |
при высокой уверенности |
Перед сохранением желательно проверять:
\left...\right;$;Итоговый Markdown должен сразу корректно отображаться через MathJax или KaTeX без дополнительной обработки.
Текущий pipeline смешивает OCR, обработку текста и генерацию Markdown.
Предлагается разделить его на независимые этапы:
PDF
│
▼
PP-StructureV3
│
▼
Извлечение структуры документа
│
├── текст
├── таблицы
├── изображения
└── display-формулы
│
▼
Постобработка OCR
│
▼
Выделение inline-формул
│
▼
Исправление типичных OCR-ошибок
│
▼
Генерация Markdown
│
▼
Валидация Markdown / LaTeX
│
▼
HTML + MathJax / KaTeX
| Компонент | Оценка |
|---|---|
| Layout | ⭐⭐⭐⭐⭐ |
| Reading order | ⭐⭐⭐⭐⭐ |
| Таблицы | ⭐⭐⭐⭐⭐ |
| Display-формулы | ⭐⭐⭐⭐☆ |
| Русский OCR | ⭐⭐⭐☆☆ |
| Inline-формулы | ⭐☆☆☆☆ |
| Генерация Markdown | ⭐⭐☆☆☆ |
Основная проблема текущего решения — не качество MathJax и не display-формул.
Критические недостатки находятся в двух местах:
До устранения этих проблем невозможно получить Markdown, пригодный для качественного отображения формул и последующего анализа LLM.