星海智算开发文档
模型 API

OCR 与文档解析

区分同步文字识别和异步文档解析,准确申报输入页数。

选择能力

目标操作结果
从图片识别文字POST /ocr同步响应,不创建图片作品
将 PDF / 图片解析为结构化文档POST /documents/parse异步任务,可能有 Markdown、JSON、ZIP 多个输出

先通过 /assets/input?model=...,使用 multipart file 上传。读取 asset.assetId。素材绑定原身份和服务,不跨 Key、跨模型随意复用。

OCR 请求

{"model":"<OCR_MODEL_ALIAS>","input_image_asset_id":"<ASSET_ID>","pages":1,"task":"ocr"}

task 只使用服务明确支持的枚举,pages 按真实输入计量。OCR 输入字段不要与解析接口的 input_document_asset_id 混用。

文档解析请求

{
  "model":"<DOCUMENT_MODEL_ALIAS>",
  "input_document_asset_id":"<ASSET_ID>",
  "original_name":"document.pdf",
  "pages":12,
  "preset":"hybrid-medium",
  "language":"ch"
}

MinerU PDF 输入需要预计页数 pages 或闭区间 page_range,例如 {"start_page":3,"end_page":8};图片按一页计量。只使用当前服务允许的格式、预设、语言和页数,原始文件名不含路径。

下载全部需要的输出

按照 异步任务 查询。succeeded 后遍历 outputs[],结合角色、MIME 和文件大小下载;不要假定输出总是单一 MP4 或只有一个文件。

输入页数不合法、素材到期、归属不匹配时先修正请求。失败任务没有可用输出,不应继续猜测下载地址。

本页目录