baidu-doc-vlm-parser调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.5多模态大模型,支持PDF、Word、PPT、图片等格式,精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素,支持111种语言,可处理不规则布局和长文档跨页解析。触发词:文档解析、VLM解析、大模型OCR、Paddl...
Install via ClawdBot CLI:
clawdbot install maglanyulan/baidu-doc-vlm-parserGrade Fair — based on market validation, documentation quality, package completeness, maintenance status, and authenticity signals.
Calls external URL not in known-safe list
https://ai.baidu.com/ai-doc/OCR/dk3iqnq51Uses known external API (expected, informational)
aip.baidubce.comAudited May 10, 2026 · audit v1.0
Generated Oct 6, 2026
银行、保险、证券机构需处理大量带印章、手写签名和不规则版面的合同、保单、票据。PaddleOCR-VL 可自动识别印章内容、手写批注和复杂表格,输出带坐标的结构化 JSON,便于接入风控与档案系统。
科研人员与知识产权机构需要从多栏排版的论文、专利中提取数学公式、图表和参考文献。该模型默认开启公式与图片识别,无需额外配置,可直接输出 Markdown 便于知识库构建。
跨境电商与物流企业需处理 100+ 种语言的装箱单、发票和报关单。模型自动识别语种,支持跨页表格合并,快速将多语种混合单据转为结构化数据,提升清关与对账效率。
医院与医疗信息化厂商需将手写病历、检验报告和影像报告单结构化。模型支持手写识别和不规则布局定位,可提取关键字段并保留行级坐标,为电子病历和科研数据平台提供数据源。
在线教育平台和学校需要解析学生手写答题卡、数学试卷和教材。模型可精准识别手写文本与公式,输出带阅读顺序的结构化结果,用于自动批改和个性化学习内容生成。
百度智能云提供 PaddleOCR-VL 的异步 API,个人实名用户免费 200 页、企业实名用户免费 1000 页,超出后按调用页数计费。开发者可按需集成,适合文档量波动较大的业务场景。
针对金融、医疗等对数据安全要求高的行业,可将 PaddleOCR-VL 模型部署在本地或专有云,结合百度智能云的授权与运维服务。企业按年支付授权费与维护费。
基于该 API 封装面向最终用户的文档解析 SaaS,提供合同审查、票据报销、知识库构建等垂直应用。平台按订阅制或按处理量向终端用户收费。
💬 Integration Tip
使用前需设置 BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 环境变量获取 access_token;API 为异步接口,需先提交任务再轮询获取结果,注意文件大小限制(版式≤100M,PDF≤500页)及结果链接 30 天有效期。
Scored Oct 6, 2026
Fetch and read transcripts from YouTube videos. Use when you need to summarize a video, answer questions about its content, or extract information from it.
Monitor RSS and Atom feeds for content research. Track blogs, news sites, newsletters, and any feed source. Use when monitoring competitors, tracking industr...
用 MinerU API 解析 PDF/Word/PPT/图片为 Markdown,支持公式、表格、OCR。适用于论文解析、文档提取。
Provides a personalized morning report with today's reminders, undone Notion tasks, and vault storage summary for daily planning.
Extract text from PDFs with OCR support. Perfect for digitizing documents, processing invoices, or analyzing content. Zero dependencies required.
Fetch scheduled economic events and data releases from the FMP API for specified dates, filtering by impact, country, and type, and output a chronological ma...