模型 API
OCR 与文档解析
区分同步文字识别和异步文档解析,准确申报输入页数。
选择能力
| 目标 | 操作 | 结果 |
|---|---|---|
| 从图片识别文字 | POST /ocr | 同步响应,不创建图片作品 |
| 将 PDF / 图片解析为结构化文档 | POST /documents/parse | 异步任务,可能有 Markdown、JSON、ZIP 多个输出 |
先通过 /assets/input?model=...,使用 multipart file 上传。读取 asset.assetId。素材绑定原身份和服务,不跨 Key、跨模型随意复用。
OCR 请求
{"model":"<OCR_MODEL_ALIAS>","input_image_asset_id":"<ASSET_ID>","pages":1,"task":"ocr"}task 只使用服务明确支持的枚举,pages 按真实输入计量。OCR 输入字段不要与解析接口的 input_document_asset_id 混用。
文档解析请求
{
"model":"<DOCUMENT_MODEL_ALIAS>",
"input_document_asset_id":"<ASSET_ID>",
"original_name":"document.pdf",
"pages":12,
"preset":"hybrid-medium",
"language":"ch"
}MinerU PDF 输入需要预计页数 pages 或闭区间 page_range,例如 {"start_page":3,"end_page":8};图片按一页计量。只使用当前服务允许的格式、预设、语言和页数,原始文件名不含路径。
下载全部需要的输出
按照 异步任务 查询。succeeded 后遍历 outputs[],结合角色、MIME 和文件大小下载;不要假定输出总是单一 MP4 或只有一个文件。
输入页数不合法、素材到期、归属不匹配时先修正请求。失败任务没有可用输出,不应继续猜测下载地址。