ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Skill Seekers 完全指南:将文档网站、GitHub 仓库与 PDF 一键转化为 AI 可用的结构化技能资产

Skill Seekers 完全指南:将文档网站、GitHub 仓库与 PDF 一键转化为 AI 可用的结构化技能资产 人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载导读Skill Seekers 是一个面向 AI 系统的数据层开源项目它把文档网站、GitHub 仓库、PDF、视频、Notebook、Wiki 等18 种来源统一转化为结构化知识资产并导出到 Claude、Gemini、OpenAI 等 AI 技能平台以及 LangChain、LlamaIndex、Pinecone 等 RAG 管道与 Cursor、Windsurf、Cline 等 AI 编码助手共22 个导出目标。读完本文你将掌握从安装、抓取、AI 增强到打包、上传、安装进各类 Agent 的完整实战链路并理解其背后基于SkillAdaptor抽象与统一调度器的源码实现原理。1. 项目定位一次准备多处使用Skill Seekers 的核心定位是The data layer for AI systemsAI 系统的数据层。它并不直接提供模型而是负责把人类可读的文档/代码/资料加工成 AI 可以直接消费的结构化知识资产使用场景输出物服务对象AI Skills完整的SKILL.md 参考文件Claude Code、Gemini、GPTRAG 管道带丰富元数据的分块文档LangChain、LlamaIndex、Haystack向量数据库可直接 upsert 的预格式化数据Pinecone、Chroma、Weaviate、FAISS、QdrantAI 编码助手IDE AI 自动读取的上下文文件Cursor、Windsurf、Cline、Continue.dev这一一次准备、四处消费的设计意味着抓取和增强工作只需要做一遍随后任意目标平台都可以直接复用无需重新抓取。2. 安装按需选择 extras项目要求Python 3.10与 Git。基础安装极其简单pip install skill-seekers # 核心抓取、GitHub、PDF、打包 pip install skill-seekers[all-llms] # 所有 LLM 平台 pip install skill-seekers[mcp] # MCP 服务器 pip install skill-seekers[all] # 全部如果拿不准需要哪些能力可以直接运行配置向导skill-seekers-setup项目的安装 extras 采用按需扩展策略下表来自 README.md 并对应仓库内的实现模块安装项额外能力skill-seekers[gemini]Google Gemini 支持skill-seekers[openai]OpenAI ChatGPT 支持skill-seekers[all-llms]全部 LLM 平台skill-seekers[mcp]面向 Claude Code、Cursor 等的 MCP 服务器skill-seekers[video]YouTube/Vimeo 字幕与元数据提取skill-seekers[video-full]额外包含 Whisper 转录与视觉帧提取skill-seekers[jupyter]Jupyter Notebook 支持skill-seekers[pptx]PowerPoint 支持skill-seekers[confluence]Confluence wiki 支持skill-seekers[notion]Notion 页面支持skill-seekers[rss]RSS/Atom feed 支持skill-seekers[chat]Slack/Discord 聊天导出支持skill-seekers[asciidoc]AsciiDoc 支持skill-seekers[all]全部提示视频视觉依赖是 GPU 感知的。安装skill-seekers[video-full]后执行skill-seekers create --setup会自动检测 GPU 并安装匹配的 PyTorch 变体与 easyocr。新手可先阅读 Bulletproof Quick Start 快速上手。3. 快速开始3 条命令产出第一个 SkillSkill Seekers 的完整工作流只需三条命令# 1. 安装 pip install skill-seekers # 2. 从任意来源创建技能自动检测来源类型 skill-seekers create https://docs.djangoproject.com/ # 可选在不创建任何内容的前提下预览来源的检测结果 skill-seekers detect https://docs.djangoproject.com/ --json # 3. 为你的 AI 平台打包 skill-seekers package output/django --target claude执行完毕后当前目录下会得到output/django-claude.zip一个开箱即用的 Claude Skill。默认 AI 增强代理是claude也可以随时切换skill-seekers create https://docs.djangoproject.com/ --agent kimi skill-seekers create https://docs.djangoproject.com/ --agent-cmd my-custom-agent run其中--agent-cmd允许接入任意自定义 CLI 代理为无法直接调用 API 的场景提供了灵活性。3.1 源码视角统一的命令分发入口从源码看所有命令都汇入同一个入口 src/skill_seekers/cli/main.pycreate、detect、scan、doctor、ui采用类式分发Command(args).execute()其余命令enhance、package、upload、install、estimate、quality、workflows、stream、update等通过模块映射分发。这种统一分发表意味着每个子命令既可独立作为skill-seekers-cmd入口运行也能共享主解析器参数。4. 自动检测detect与来源类型判断skill-seekers detect source --json用于不落地任何产物地预览来源类型识别结果非常适合脚本化调用或在 CI 中确认输入类型。自动检测由 src/skill_seekers/cli/source_detector.py 中的SourceDetector类实现它通过 GitHub 仓库名正则owner/repo模式与github.com/...URL 模式识别仓库来源并结合 URL、扩展名与本地路径特征识别 web、local、PDF、config 等类型。值得注意的是从源码注释可以看出Confluence、Notion、Slack/Discord 聊天这类基于 API/导出的来源无法从单个参数自动推断需要走各自专属的子命令--space-key、--database-id、--chat-export-path等。5. 全部 18 种来源类型Skill Seekers 的create命令对输入做统一检测只需把不同类型的源直接当作参数传入skill-seekers create facebook/react # GitHub 仓库 skill-seekers create ./my-project # 本地代码库 skill-seekers create manual.pdf # PDF skill-seekers create report.docx # Word skill-seekers create book.epub # EPUB skill-seekers create notebook.ipynb # Jupyter skill-seekers create openapi.yaml # OpenAPI/Swagger skill-seekers create presentation.pptx # PowerPoint skill-seekers create guide.adoc # AsciiDoc skill-seekers create page.html # 本地 HTML或整个目录 skill-seekers create feed.rss # RSS/Atom skill-seekers create curl.1 # Man page # 视频YouTube、Vimeo 或本地文件——需要 skill-seekers[video] skill-seekers create --video-url https://www.youtube.com/watch?v... --name mytutorial skill-seekers create --setup # 自动安装 GPU 感知的视觉依赖 skill-seekers create --space-key TEAM --name wiki # Confluence skill-seekers create --database-id ... --name docs # Notion skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord每种来源的详细参数见 Scraping Guide。5.1 源码视角统一调度的来源分派表从 src/skill_seekers/cli/unified_scraper.py 的SOURCE_DISPATCH可以看到多来源抓取是同一套调度逻辑documentation、github、pdf、word、video、local、epub、jupyter、html、openapi、asciidoc、pptx、confluence、notion、rss、manpage、chat各映射到独立的_scrape_*处理函数形成一个统一入口、按类型分发的架构。6. AI 驱动的项目扫描scanscan命令面向已有代码项目让一个 AI 代理读取项目的 manifests、README、Dockerfile/CI 以及采样源码导入语句然后为检测到的每个框架各生成一份配置外加一份针对你自己代码的project-codebase.jsonskill-seekers scan ./my-react-app --out ./configs/scanned/ # → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json skill-seekers create ./configs/scanned/react.json如果某个检测结果没有现成预设AI 会现场生成全新配置退出时还可选择将配置发布回社区注册表。仓库 configs/ 目录中已经存放了多份真实可用的配置示例如 react.json、godot_unified.json、unity-spine.json 等可直接作为skill-seekers create configs/xxx.json的输入。7. 多来源统一配置一份 config 抓取整个知识域create也可以直接接收一份 JSON 配置文件一次性聚合多个来源。以仓库内置的 configs/react.json 为例它同时包含documentationreact.dev 官网带 CSS 选择器、URL 排除规则、主题分类与限速和githubfacebook/react 源码仓库开启代码库分析、issue 与 release 抓取两类来源{ name: react, description: Complete React knowledge base combining official documentation and React codebase insights., version: 1.1.0, merge_mode: rule-based, sources: [ { type: documentation, base_url: https://react.dev/, extract_api: true, selectors: { main_content: article, title: h1, code_blocks: pre code }, url_patterns: { include: [], exclude: [/blog/, /community/] }, categories: { getting_started: [learn, installation, quick-start], components: [components, props, state], hooks: [hooks, usestate, useeffect, usecontext], api: [api, reference], advanced: [context, refs, portals, suspense] }, rate_limit: 0.5 }, { type: github, repo: facebook/react, enable_codebase_analysis: true, code_analysis_depth: deep, fetch_issues: true, max_issues: 100, fetch_changelog: true, fetch_releases: true, file_patterns: [ packages/react/src/**/*.js, packages/react-dom/src/**/*.js ] } ], base_url: https://react.dev/ }merge_mode支持rule-based与ai-enhanced两种合并策略后者对应源码中的AIEnhancedMerger前者对应RuleBasedMerger均位于 src/skill_seekers/cli/merge_sources.py。多来源会先经过冲突检测器conflict_detector.py识别来源间的冲突再进行跨来源配对合成。完整配置格式见 CONFIG_FORMAT.md统一抓取细节见 UNIFIED_SCRAPING.md。8. AI 增强API 模式与 LOCAL 模式所有 AI 调用都通过同一条传输通道完成支持两种模式API 模式Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax直接调用云端模型LOCAL 模式Claude Code、Kimi Code、Codex、Copilot、OpenCode 或自定义代理无 API 费用。增强深度由--enhance-level 0-3控制代理选择由--agent指定。最终产出通常是500 行以上、包含示例、模式与指南的SKILL.md。skill-seekers create ./my-project --preset quick # 1–2 分钟浅层 skill-seekers create ./my-project --preset standard # 均衡默认 skill-seekers create ./my-project --preset comprehensive # 深度、穷尽GitHub/代码库分析采用C3.x 三流架构代码流AST、设计模式、测试、文档流README、docs/、wiki、社区流issues、PRs、元数据并内置跨 9 种语言的 10 个 GoF 模式检测器。相关深度文档Enhancement Guide · Enhancement Modes · Multi-Agent SetupPattern Detection · How-To Guides · Test Example Extraction9. 打包导出22 个目标平台package负责把加工好的目录打包成各平台可识别的产物skill-seekers package output/react --target claude # → Claude SkillZIP YAML skill-seekers package output/react --target langchain # → LangChain Documents skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes skill-seekers package output/react --target ibm-bob # → IBM Bob skill 目录完整目标分类如下LLM 平台12 个claude·gemini·openai·minimax·opencode·kimi·deepseek·qwen·openrouter·together·fireworks·markdownRAG 与向量库8 个langchain·llama-index·haystack·chroma·faiss·weaviate·qdrant·pinecone其他2 个atlas·ibm-bob各平台支持细节见 Feature Matrix。9.1 源码视角SkillAdaptor抽象基类22 个目标之所以能共享同一套上游产物是因为它们都实现同一个抽象接口 src/skill_seekers/cli/adaptors/base.py 中的SkillAdaptorABC每个适配器负责平台特定的SKILL.md格式化、打包结构ZIP、tar.gz 等、上传端点与鉴权以及可选的 AI 增强能力。仓库adaptors/目录下的 20 个文件claude.py、gemini.py、openai.py、langchain.py、qdrant.py、weaviate.py等即对应全部导出目标。抓取与增强只需一次打包时按需选择适配器即可。10. 技能内的搜索索引可选skill-seekers create source --index会在生成的技能目录中加入仅依赖标准库的scripts/search.py并基于生成的参考文件构建SQLite FTS5 全文索引。这样 Agent 在通读大型 Markdown 之前可以先通过检索定位到正确的file#anchor显著降低大文档场景的 token 开销。该功能默认关闭且不会改动原始 Markdown 内容。详见 Skill Search Index。11. MCP 集成40 个工具面向主流 IDESkill Seekers 自带 MCP 服务器可接入 Claude Code、Cursor、Windsurf、VS Code Cline、IntelliJ IDEA 等环境# stdio 模式Claude Code、VS Code Cline python -m skill_seekers.mcp.server_fastmcp # HTTP 模式Cursor、Windsurf、IntelliJ python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765启动后即可直接用自然语言驱动整个流水线例如Package and upload the React skill.。从 src/skill_seekers/mcp/server_fastmcp.py 的模块说明可以看到工具按功能划分为配置类generate_config、list_configs、validate_config、抓取类scrape_docs、scrape_github、scrape_pdf、scrape_video等、打包类package_skill、upload_skill、enhance_skill、install_skill、拆分类、来源管理类、市场类与向量库导出类。HTTP 传输的详细用法见 HTTP_TRANSPORT.md。12. 安装到 19 个 AI 编码代理生成的技能可一键安装进19 个 AI 编码代理skill-seekers install-agent output/react/ --agent cursor skill-seekers install-agent output/react/ --agent all # 安装到所有检测到的代理 skill-seekers install-agent output/react/ --agent cursor --dry-run安装位置与作用域对应关系如下摘自 README.md代理路径作用域Claude Code~/.claude/skills/全局Cursor.cursor/skills/项目VS Code / Copilot.github/skills/项目Amp~/.amp/skills/全局Goose~/.config/goose/skills/全局OpenCode~/.opencode/skills/全局Letta~/.letta/skills/全局Aide~/.aide/skills/全局Windsurf~/.windsurf/skills/全局Neovate~/.neovate/skills/全局Roo Code.roo/skills/项目Cline.cline/skills/项目Aider~/.aider/skills/全局Bolt.bolt/skills/项目Kilo Code.kilo/skills/项目Continue~/.continue/skills/全局Kimi Code~/.kimi/skills/全局IBM Bob.bob/skills/项目12.1 上传到 Claudeexport ANTHROPIC_API_KEYsk-ant-... skill-seekers package output/react/ --upload # 打包并上传 skill-seekers upload output/react.zip # 上传已存在的 zip没有 API Key 时也可以打包后手动把output/react.zip上传到 claude.ai/skills。完整流程见 Upload Guide。13. 工作原理五步流水线与 8 大核心模块README 中给出了端到端流水线Scrape → Categorize → Enhance → Package → UploadScrape——提取每个页面优先检查llms.txtCategorize——把内容组织成主题API、指南、教程等Enhance——AI 撰写带示例的完整SKILL.mdPackage——打包为平台就绪产物Upload——可选投递到你的 AI 平台。架构上由8 个核心模块 5 个工具模块约 200 个类组成模块职责CLICoreGit 风格命令分发器、来源自动检测Scrapers18 种来源类型的提取器共享同一构建层Adaptors22 种输出平台格式统一实现SkillAdaptorABCAnalysisC3.x 代码库流水线、10 个 GoF 模式检测器Enhancement通过单一AgentClient传输通道完成 AI 增强Packaging打包、上传与安装技能MCPFastMCP 服务器40 个工具、10 个工具模块Sync文档变更检测与通知深度内容见 UML Architecture含 14 张 UML 图、API Reference 与 Skill Architecture。14. 质量、同步与规模14.1 质量门槛skill-seekers quality output/react/ --threshold 7 # 质量评分 门槛 skill-seekers quality output/react/ --json # JSON 输出供 CI 使用同时提供面向英文的可读性指标仅作参考不影响最终分数。详见 CODE_QUALITY.md。14.2 文档变更同步与超大规模处理sync-config用于检测配置漂移支持文档变更检测、定时重抓取与通知对超大规模文档集1 万–4 万 页提供流式摄入stream与增量更新update详见 Large Documentation。14.3 性能参考来自 README文档规模耗时输出体积小 100 页5–10 分钟~2 MB中100–500 页15–30 分钟~10 MB大500–2,000 页30–60 分钟~40 MB超大10K–40K 页使用stream见 LARGE_DOCUMENTATION15. 故障排查skill-seekers doctor # 诊断安装与环境 skill-seekers doctor --json # 机器可读诊断供 CI 与 Agent 使用 skill-seekers sync-config # 检测配置漂移常见问题见 Troubleshooting Guide 与 TROUBLESHOOTING.md。16. 小结Skill Seekers 用一个统一的数据处理流水线把把文档变成 AI 技能这件事从数天的人工整理压缩到十几分钟来源自动检测 → 多源统一抓取 → 冲突检测与合并 → AI 增强 → 22 目标打包 → 一键安装/上传。其可扩展性来自两处源码设计SkillAdaptor抽象新平台只需新增一个适配器与统一的命令/来源分派表src/skill_seekers/cli/main.py、src/skill_seekers/cli/unified_scraper.py。本文覆盖的完整命令索引见 CLI_REFERENCE.md更多集成方案LangChain、RAG Pipelines、Cursor、Windsurf、Cline见 docs/integrations 目录。赞分享人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载相关推荐Skill Seekers Skill Builder用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI SkillSkill Seekers Skill Builder用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill 本文围绕 Skill Seeke人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 快速上手3 步把文档网站与代码仓库转化为可直接使用的 AI 技能Skill Seekers 快速上手3 步把文档网站与代码仓库转化为可直接使用的 AI 技能 本文以仓库中的历史文档 QUICKSTART.md https:人工智能AI 应用AI 技能RAGMCP 服务网页爬虫5大关键技术突破HackRF射频开关如何重新定义软件无线电的灵活性边界5大关键技术突破HackRF射频开关如何重新定义软件无线电的灵活性边界 在当今无线通信技术飞速发展的时代软件定义无线电SDR已成为研究和开发的重要工具。人工智能AI 应用AI 技能RAGMCP 服务网页爬虫创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表