开源 #开源模型 2026-10-09 · 原文发布 10-08

LightOn 开源 LightOnOCR-3:0.8B 到 4B 三个尺寸,Apache 2.0,olmOCR-Bench 最高 86.3

小参数的文档解析模型,新增带坐标的 grounding 模式,适合把 PDF、扫描件转成结构化文本。

一手来源 LightOn · Hugging Face 博客 · huggingface.co 读原文 ↗

// 要点

  • 三个模型 0.8B、1B、4B,Apache 2.0,可商用;0.8B 和 4B 改用 Qwen3.5 视觉语言架构。
  • olmOCR-Bench 总分:4B 86.3、0.8B 85.5、1B 84.5;参数 35.1B 的 Infinity Parser Pro 为 87.6。ParseBench 上 4B 75.1,高于 Infinity Parser Pro 的 74.3。
  • 1540 px 分辨率下吞吐最高 0.8B 每秒 4.78 页、4B 每秒 3.36 页;1B 单页延迟最低,2.7 秒。
  • 新的 grounding 模式输出带标签的边界框、图片描述,并把图表数据转成 HTML 表格。

开发者视角0.8B 只比 4B 低不到 1 分,这对 AI 云盘的文档解析很有吸引力:我会先拿用户上传最多的扫描件和带表格的 PDF 做一轮对比,看能不能把一部分解析从云端 API 挪到自己的机器上。

// 来龙去脉 · 来自 #开源模型 专题

看完整时间线 →
  1. 10-09 Liquid AI 开放 d1 决策模型:d1-3B 一次前向给出判断,RTX 4090 上单题 8 毫秒
  2. 10-09 NVIDIA 微调 Nemotron 拿下 IOI 2026 535.4/600、IMO 2026 30/42 金牌线成绩,并开放权重与训练数据
  3. 10-07 Mistral Large 4 公开预览:1T 总参数、49B 激活,API 每百万 token 输入 1.36 美元,权重月底开放