
数据采集-OCR 数据提取-1
管理科学
文史哲
自然语言处理
大语言模型
skill
OCR 数据提取的首选主路径:用户已持有本地授权扫描件、页面质量与版式大体规整时,按“批次准入→单引擎整页识别→置信度分级→页级台账”执行,交付页级抽取清单、低置信度队列与覆盖率报告。适用于印刷体扫描页的常规提取;低质量扫描、倾斜旋转、手写混排或单引擎前提不成立时不要使用本 Skill,应改走双通道交叉核对备选路径。不处理文本层 PDF(那是解析不是 OCR),不做网页抓取。