LightOn 开源 LightOnOCR-3:0.8B 到 4B 三个尺寸,Apache 2.0,olmOCR-Bench 最高 86.3
小参数的文档解析模型,新增带坐标的 grounding 模式,适合把 PDF、扫描件转成结构化文本。
// 要点
- 三个模型 0.8B、1B、4B,Apache 2.0,可商用;0.8B 和 4B 改用 Qwen3.5 视觉语言架构。
- olmOCR-Bench 总分:4B 86.3、0.8B 85.5、1B 84.5;参数 35.1B 的 Infinity Parser Pro 为 87.6。ParseBench 上 4B 75.1,高于 Infinity Parser Pro 的 74.3。
- 1540 px 分辨率下吞吐最高 0.8B 每秒 4.78 页、4B 每秒 3.36 页;1B 单页延迟最低,2.7 秒。
- 新的 grounding 模式输出带标签的边界框、图片描述,并把图表数据转成 HTML 表格。
开发者视角0.8B 只比 4B 低不到 1 分,这对 AI 云盘的文档解析很有吸引力:我会先拿用户上传最多的扫描件和带表格的 PDF 做一轮对比,看能不能把一部分解析从云端 API 挪到自己的机器上。