doc-preprocess医疗文档预处理公共库。将 pdf/doc/docx/xls/xlsx/csv/txt/json/图片等多格式文件统一加载为标准中间产物(pages / text / json / tables),供其他 skill 的 run.py 调用。
Install via ClawdBot CLI:
clawdbot install unisound-llm/doc-preprocessGrade Fair — based on market validation, documentation quality, package completeness, maintenance status, and authenticity signals.
Calls external URL not in known-safe list
http://schemas.openxmlformats.org/wordprocessingml/2006/mainAudited Sep 8, 2026 · audit v1.0
Generated Sep 8, 2026
从多格式医疗文档中提取文本,自动生成电子病历摘要,减少医生手工录入时间。可辅助慢病随访记录和多学科会诊摘要。
利用预处理库标准化来自不同系统的医疗文档,检查字段缺失、格式错误或数据不一致,提高数据质量。
将PDF、DOCX等格式的医学文献统一解析为文本或结构化数据,用于构建检索式知识库,辅助临床决策支持。
对含有影像报告的图片或扫描文档进行OCR识别,将其文本化并抽取关键检查结果,存储为结构化数据,供后续分析或集成到LIS系统。
结合病历、检验报告、影像结果等多源异构数据,首先通过预处理标准化为统一格式,支持大数据驱动的疾病风险分层和预后评估。
向保险、医院或医疗IT公司提供文档预处理API,按调用量或包月收费,降低客户自研成本。
将预处理工具作为医疗信息化解决方案模块进行许可,向医院或医疗集团收取一次性授权费和年维护费。
作为数据处理服务的一部分,按处理的文档数量或项目规模收取佣金,通常用于药物警戒或临床试验文档处理。
💬 Integration Tip
该库是共享工具集,适合被其他技能调用,而非独立运行。集成时注意检查可选依赖(如pypdf、tesseract)是否安装,并合理选择PDF为单文本还是分页模式。
Scored Sep 8, 2026
PDF智能处理工具 v2.1 | PDF Smart Tool. 支持PDF转换、OCR识别、合并拆分、数字签名、批量处理、水印添加、加密解密。触发词:PDF、转换、识别。
Generate hand-drawn style diagrams, flowcharts, and architecture diagrams as PNG images from Excalidraw JSON
Convert public web pages into clean Markdown with markdown.new for AI workflows. Use when tasks require URL-to-Markdown conversion for summarization, RAG ing...
PDF扫描件转Word文档。支持中文OCR识别,自动裁掉页眉页脚,保留插图,彩色章节封面页保留为图片。使用百度OCR API(免费额度1000次/月)。当用户要求把扫描PDF转成文字/Word时触发。
Word文档处理工具套件,提供Word文档的创建、读取、内容提取和基本处理功能。
Microsoft SharePoint and OneDrive integration with managed OAuth. Manage sites, lists, libraries, files, folders, permissions, content types, and SharePoint...