Повысить качество Markdown, генерируемого из PDF с помощью PP-StructureV3, чтобы результат можно было использовать для:
$$
...
$$
Текущая проблема:
\$R=r\^{}\{2\}\$
или
\textbackslash{}sim
Такой вывод недопустим.
Требования:
$R=r^{2}$
или
$u_i \sim N(0,1)$
\textbackslash{}\$Запрещается преобразовывать
\alpha
\sqrt
\frac
\sim
\left
\right
в
\textbackslash{}alpha
\textbackslash{}sqrt
...
Markdown должен содержать настоящий LaTeX.
Исправлять наиболее типичные OCR-ошибки.
Например
| Было | Должно стать |
|---|---|
V a R |
VaR |
P D |
PD |
N ^ {-1} |
N^{-1} |
l вместо 1 |
исправлять при высокой уверенности |
O вместо 0 |
исправлять при высокой уверенности |
По возможности выделять математические выражения внутри абзацев.
Например
where u_i ~ N(0,1)
↓
where $u_i \sim N(0,1)$
Даже если PP-StructureV3 не выделил их отдельным Formula Block.
Не использовать экспорт в полноценный .tex.
Целевой формат — Markdown.
Формулы должны быть совместимы с MathJax и KaTeX.
Перед сохранением желательно проверить:
\left...\right;$;Некорректный LaTeX должен логироваться.
Запрещается появление конструкций вида
\textbackslash{}
\$
\_
если они являются следствием экранирования LaTeX.
В итоговом Markdown должен оставаться исходный LaTeX.
Markdown должен без дополнительной обработки корректно преобразовываться в HTML с использованием MathJax или KaTeX.
После конвертации все формулы должны отображаться без ручного исправления.
Не смешивать OCR, исправление текста и генерацию Markdown в одном проходе.
Рекомендуемый pipeline:
Это позволит независимо улучшать качество OCR, постобработки и форматирования без изменения остальных этапов.