分享文章
TeleOCR中国电信星辰实验室开源的文档解析模型

TeleOCR是什么
TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。TeleOCR 登顶 OmniDocBench v1.6 榜单,获 PureDocBench 榜首和 ICDAR-2026 科学图解析冠军,支持本地 GPU 部署,适用合同、论文、档案等结构化提取场景。

TeleOCR的主要功能
- 文字识别:高精度提取文档中的文本内容,数字文档识别准确率达 97.22。
- 版面分析:定位文字、表格、公式等元素在页面中的位置与层级关系。
- 表格解析:精确还原跨行跨列、单元格合并的复杂表格结构,TEDS 达 97.05。
- 公式解析:结构化解析公式语义与语法,实现符号级准确恢复,CDM 达 96.36。
- 科学图表解析:识别图表元素并提取数据,可转换论文柱状图为结构化表格(ICDAR-2026 冠军能力)。
- 拍摄文档处理:直接处理透视畸变、页面弯曲、阴影模糊等真实拍摄退化文档,无需独立去畸变模型。
- 结构化输出:结果可生成为 Markdown、JSON、表格、公式等格式,便于接入知识检索与业务系统。
TeleOCR的技术原理
统一视觉语言架构:TeleOCR 采用约 1.2B 参数的轻量级视觉语言模型,将数字文档与相机拍摄文档放入同一框架,端到端完成版面与内容解析,替代传统”版面检测→图像校正→识别”的串联流水线,避免误差累积。
几何感知建模:针对不规则页面形变,引入几何感知建模与曲率引导的 Douglas-Peucker 采样,显式学习文档边界与空间结构,使模型能直接处理弯曲、折叠和透视畸变页面。
数据工程闭环:数据体系覆盖生成、清洗、评估与优化:通过多节点共识投票筛选高置信伪标签;几何感知数据合成围绕旋转、畸变、弯曲构造样本;图像到图像自验证将解析结果重新渲染比对以自动纠错;渐进式清洗让高一致性样本进训练集、高分歧样本作难例优化,形成投票筛选—模型自训练闭环。
渐进式四阶段训练:训练按”视觉语言对齐→几何感知文档解析→内容-结构解耦学习→强化学习”推进,目标从基础感知过渡到精细理解。表格任务用 Structure-only强化行列结构理解,再用 Structure+Content 完成联合对齐;公式任务同样通过解耦学习语义与语法组织。
微信关注回复“开源”,加入AI开源项目交流群
如何使用TeleOCR
- 环境准备:安装 Python 3.10+ 并确保有支持 CUDA 的 GPU 环境。
- 拉取代码:执行 git clone https://github.com/caipeng328/TeleOCR.git 并进入目录。
- 创建环境:用 conda 创建名为 teleocr 的虚拟环境并激活。
- 安装依赖:运行 pip install -e . 安装项目依赖。
- 下载模型:通过 pip install modelscope 后用 modelscope 命令下载权重到本地 ./models/TeleOCR 目录。
- 准备目录:设置输入图片目录 IMAGE_SUB_PATH 和结果输出目录 RESULT_SAVE_PATH。
- 运行推理:执行 python infer.py,传入图片路径、结果路径、--use_async、--override、模型路径及后端参数。
- 选择后端:常规使用 vllm-engine,高并发批量处理可切换 vllm-async-engine。
- 设置版面模式:数字文档用 LAYOUT_MODE="Detection",弯曲/退化拍摄页面切换为 "Segmentation"。
- 调优参数:按需调整 MAX_MODEL_LEN(上下文长度)、GPU_MEMORY_UTILIZATION(显存占用)、PDF_TOOLS(PDF 后端)和 MAX_PIXELS(单页最大像素数)。
- 获取结果:从输出目录读取解析后的 Markdown/JSON/表格等结构化结果,接入下游系统。
TeleOCR的核心优势
- 榜单成绩领先:OmniDocBench v1.6 总分 96.87 登顶,超越 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等专业模型。
- 参数轻量:仅约 1.2B 参数,降低本地部署门槛,适合私有化场景。
- 统一框架:数字文档与相机拍摄文档在同一模型内解析,无需为不同来源文档部署多套系统。
- 免前置去畸变:几何感知建模可直接处理弯曲、折叠、透视畸变页面,减少独立校正模块的误差累积。
- 结构化输出:直接输出 Markdown、JSON、表格、公式等可计算结果,便于接入知识检索与业务自动化。
- 复杂表格能力强:跨行跨列、单元格合并的复杂表格行列表系不乱、不串位,TEDS 达 97.05。
- 科学图解析夺冠:具备图表元素识别与数据提取能力,获 ICDAR-2026 科学图解析挑战赛冠军。
- 数据闭环高效:多节点共识投票与自验证机制构建千万级训练数据池,大部分生成数据无需人工标注。
TeleOCR的项目地址
GitHub仓库:https://github.com/caipeng328/TeleOCR
HuggingFace模型库:https://www.modelscope.cn/models/XingChen-AGI/TeleOCR
arXiv技术论文:https://arxiv.org/pdf/2608.12898
TeleOCR的同类竞品对比
| 对比维度 | TeleOCR | PaddleOCR-VL-1.6 |
|---|---|---|
| 模型规模 | 约 1.2B 参数,轻量级 | 0.9B 参数 |
| OmniDocBench v1.6 总分 | 96.87,登顶榜单 | 未登顶 |
| 文本识别 | 97.22 | 96.7 |
| 表格解析 TEDS | 97.05 | 94.76 |
| 拍摄文档表格 TEDS(Wild) | 89.05 | 81.31 |
| 拍摄文档处理 | 几何感知建模,免独立去畸变模块 | 文档未说明同类机制 |
| 科学图解析 | ICDAR-2026 挑战赛冠军(41.81 分) | 文档未提及参赛成绩 |
| 结构化输出 | Markdown / JSON / 表格 / 公式 | 支持结构化输出 |
TeleOCR的应用场景
- 合同与档案数字化:解析合同、档案中的跨行跨列表格与版面结构,转为可检索的结构化数据。
- 科研论文解析:提取论文中的公式、表格及柱状图数据,助力文献分析与知识库构建。
- 金融票据处理:识别发票、表单等拍摄件,容忍透视畸变与模糊,自动录入业务系统。
- 教育试题录入:将试卷中的印刷公式、表格题目转为可编辑格式,支撑题库建设与智能批改。
- 企业报表自动化:把扫描报表、业务表单批量转为结构化表格,接入数据分析与 RPA 流程。

[超站]友情链接:
四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/



![姜珮瑶 感觉回到18岁!开心 未来一起加油冲冲冲![抱一抱] ](https://imgs.knowsafe.com:8087/img/aideep/2023/4/9/67f4a20626956238daee6cff5729e492.jpg?w=204)

![肖雨(一条又冷又热的微博子···[yeah])](https://imgs.knowsafe.com:8087/img/aideep/2025/12/11/f9c2c70a81f841630c4070a916a4bffe.jpg?w=204)


顾灵曦
关注网络尖刀微信公众号
