web-crawler网页爬虫工具,支持静态和动态页面爬取、媒体下载、反爬虫规避。激活条件:用户提到爬虫、爬取、crawler、scraper、抓取网页、下载媒体
Install via ClawdBot CLI:
clawdbot install jinkang19940922/web-crawlerGrade Limited — based on market validation, documentation quality, package completeness, maintenance status, and authenticity signals.
Calls external URL not in known-safe list
https://example.comAudited Apr 17, 2026 · audit v1.0
Generated May 22, 2026
定期爬取竞争对手的网站结构和内容,分析其关键词策略和站内优化方法,从而制定针对性的SEO优化方案。适用于营销团队快速获取市场情报。
动态爬取电商平台商品页面的价格、库存和促销信息,实时跟踪竞品价格变动,辅助定价决策和促销策略调整。适用于电商运营团队。
爬取多个新闻网站的标题和正文内容,聚合热点事件和舆情趋势,帮助企业或公关团队快速掌握公众舆论动向。
爬取学术论文网站和在线图书馆的元数据及全文,自动下载相关PDF和图片,用于科研文献整理和资料库建设。
动态渲染并抓取社交媒体时间线、评论和用户信息,支持反爬虫机制,为市场调研和用户画像提供数据支持。
提供定制的数据采集和清洗服务,客户按爬取的网站数量或数据量付费。适合中小型企业获取市场调研数据。
将爬虫功能封装成标准API接口,客户按请求次数或套餐订阅,支持实时调用和定时任务。适合开发者和SaaS平台。
通过爬虫批量下载公开媒体资源(图片、视频、音频),建立结构化素材库,向内容创作者或企业提供订阅访问。
💬 Integration Tip
集成到现有工作流时,建议先通过crawl函数抓取小规模示例页面,验证配置再批量执行。
Scored Jul 12, 2026
A fast Rust-based headless browser automation CLI with Node.js fallback that enables AI agents to navigate, click, type, and snapshot pages via structured commands.
Uses a headless browser to navigate web pages, interact with elements, and extract clean, readable text content from URLs.
Headless browser automation CLI optimized for AI agents with accessibility tree snapshots and ref-based element selection
通过已登录的Edge或Chrome浏览器,利用Chrome DevTools Protocol执行JS渲染页面的导航、点击、截图及数据提取等自动化操作。
Send and receive SMS/RCS via Google Messages web interface (messages.google.com). Use when asked to "send a text", "check texts", "SMS", "text message", "Google Messages", or forward incoming texts to other channels.
High-performance browser automation for heavy scraping, multi-tab management, and precise DOM extraction. Use this when you need speed, reliability, or advanced state management (cookies/local storage) beyond standard web fetching.