ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Skill Seekers 实战指南:将文档网站、GitHub 仓库与 PDF 一键转化为 AI Skills

Skill Seekers 实战指南:将文档网站、GitHub 仓库与 PDF 一键转化为 AI Skills 人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载本文是 Skill Seekers 项目的完整技术指南系统讲解如何把文档网站、GitHub 仓库、PDF、视频等 18 种来源转化为可供 Claude、Gemini、OpenAI 等平台直接使用的结构化知识资产AI Skills并支持导出到 LangChain、Pinecone 等 22 个 RAG/IDE 目标。读完本文你将掌握create、scan、enhance、package、upload、install-agent等核心命令的完整用法理解其三层文档发现、C3.x 代码分析、双模式 AI 增强与 MCP 集成的底层实现原理并能基于仓库源码定位每个环节的实现位置。项目定位为 AI 系统构建数据层Skill Seekers 的定位是为 AI 系统提供数据层它把分散的文档站点、代码仓库、PDF、视频、笔记本、Wiki 等资源转换成结构化的知识资产供给 AI SkillsClaude、Gemini、OpenAI、RAG 流水线LangChain、LlamaIndex、Pinecone以及 AI 编码助手Cursor、Windsurf、Cline使用。其核心理念是一次准备、处处导出——同一份知识资产可以不打磨地导出到 22 个目标平台。从项目元数据看该仓库要求 Python 3.10当前开发版本号为3.10.0.dev0pyproject.toml核心依赖覆盖异步爬取httpx、AI 增强anthropic、PDF 解析PyMuPDF、RAG 生态langchain、llama-index等所有可选能力均通过 extras 按需安装。快速开始3 条命令产出第一个 SkillSkill Seekers 的核心工作流极简官方 Quick Start 仅需三步# 1. 安装 pip install skill-seekers # 2. 从任意来源创建 skill自动检测来源类型 skill-seekers create https://docs.djangoproject.com/ # 3. 为你的 AI 平台打包 skill-seekers package output/django --target claude执行完毕后你将得到output/django-claude.zip可直接导入 Claude 使用。如果希望由其他 AI 代理执行内容增强默认使用 Claude可以指定代理# 选择其他 AI 代理默认: claude skill-seekers create https://docs.djangoproject.com/ --agent kimi skill-seekers create https://docs.djangoproject.com/ --agent-cmd my-custom-agent run从源码看create是统一 CLI 的分发入口之一main.py 中通过COMMAND_CLASSES将create映射到CreateCommand类并支持--help-web、--help-github、--help-pdf、--help-video、--help-config等渐进式帮助标志方便按场景查看子选项。此外create命令对来源类型自动检测URL、owner/repo、本地文件路径均可直接传入。AI 驱动的项目扫描scan 命令scan命令面向已有代码库让 AI 代理读取项目的 manifest、README、Dockerfile/CI 及抽样源码导入语句为每个识别出的框架生成一份 config并为你的自有代码生成一份project-codebase.jsonskill-seekers scan ./my-react-app --out ./configs/scanned/ # → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json skill-seekers create ./configs/scanned/react.json如果某个检测结果没有现成预设AI 会现场生成新 config退出时可选择将其发布回社区 config 注册表configs 目录收录了 react、godot、unity-dotween、claude-code 等大量既有示例可作为 config 格式参考。scan同样通过COMMAND_CLASSES分发到 scan_command.py 的ScanCommand。覆盖 18 种来源类型create命令支持 18 种来源类型几乎涵盖常见知识载体skill-seekers create facebook/react # GitHub 仓库 skill-seekers create ./my-project # 本地代码库 skill-seekers create manual.pdf # PDF skill-seekers create report.docx # Word skill-seekers create book.epub # EPUB skill-seekers create notebook.ipynb # Jupyter skill-seekers create openapi.yaml # OpenAPI/Swagger skill-seekers create presentation.pptx # PowerPoint skill-seekers create guide.adoc # AsciiDoc skill-seekers create page.html # 本地 HTML或整个目录 skill-seekers create feed.rss # RSS/Atom skill-seekers create curl.1 # Man page # 视频YouTube、Vimeo 或本地文件 —— 需要 skill-seekers[video] skill-seekers create --video-url https://www.youtube.com/watch?v... --name mytutorial skill-seekers create --setup # 自动安装 GPU 感知的视觉依赖 skill-seekers create --space-key TEAM --name wiki # Confluence skill-seekers create --database-id ... --name docs # Notion skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord每种来源类型对应的抓取选项详见抓取指南。在源码层面这些能力由src/skill_seekers/cli/下的多个抓取器实现例如 unified_scraper.py、github_scraper.py、pdf_scraper.py、video_scraper.py、confluence_scraper.py、notion_scraper.py 等它们共享一套统一的构建层scraper_utils保证不同来源产出结构一致的中间结果。安装方式与可选扩展基础安装只需核心依赖各平台支持以 extras 方式按需添加pip install skill-seekers # 核心scraping、GitHub、PDF、打包 pip install skill-seekers[all-llms] # 所有 LLM 平台 pip install skill-seekers[mcp] # MCP 服务器 pip install skill-seekers[all] # 全部能力不确定需要哪些依赖运行向导skill-seekers-setup。安装添加内容skill-seekers[gemini]Google Gemini 支持skill-seekers[openai]OpenAI ChatGPT 支持skill-seekers[all-llms]所有 LLM 平台skill-seekers[mcp]面向 Claude Code、Cursor 等的 MCP 服务器skill-seekers[video]YouTube/Vimeo 转录与元数据提取skill-seekers[video-full] Whisper 转录与视觉帧提取skill-seekers[jupyter]Jupyter Notebook 支持skill-seekers[pptx]PowerPoint 支持skill-seekers[confluence]Confluence Wiki 支持skill-seekers[notion]Notion 页面支持skill-seekers[rss]RSS/Atom 源支持skill-seekers[chat]Slack/Discord 聊天导出支持skill-seekers[asciidoc]AsciiDoc 支持skill-seekers[all]全部能力视频视觉依赖GPU 感知安装skill-seekers[video-full]后运行skill-seekers create --setup会自动检测你的 GPU 并安装匹配的 PyTorch 变体与 easyocr。这些 extras 与 pyproject.toml 中的[project.optional-dependencies]一一对应mcp引入mcp1.25,2与 HTTP/SSE 相关依赖video-full引入yt-dlp、faster-whisper、opencv-python-headless等rag-upload则聚合 Chroma、Weaviate、Pinecone 等向量库客户端。前置条件为 Python 3.10 与 Git新用户推荐先读防错快速开始。输出物一份知识资产22 个导出目标用途输出谁来消费AI Skills详细的SKILL.md 引用文件Claude Code、Gemini、GPTRAG 流水线带丰富元数据的切片文档LangChain、LlamaIndex、Haystack向量数据库预格式化、可直接 upsert 的数据Pinecone、Chroma、Weaviate、FAISS、QdrantAI 编码助手IDE AI 自动读取的上下文文件Cursor、Windsurf、Cline、Continue.dev22 个导出目标skill-seekers package output/react --target claude # → Claude SkillZIP YAML skill-seekers package output/react --target langchain # → LangChain Documents skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes skill-seekers package output/react --target ibm-bob # → IBM Bob skill 目录LLM 平台12claude·gemini·openai·minimax·opencode·kimi·deepseek·qwen·openrouter·together·fireworks·markdownRAG 与向量库8langchain·llama-index·haystack·chroma·faiss·weaviate·qdrant·pinecone其他2atlas·ibm-bob在源码层面这 22 个目标由src/skill_seekers/cli/adaptors/目录下的平台适配器实现adaptors它们全部继承自 base.py 中定义的SkillAdaptor抽象基类。该基类通过format_skill_md()、package()、upload()三个抽象方法规定了统一的平台差异边界例如 Claude 使用 YAML frontmatter markdown 并以 ZIP 打包Gemini 使用纯 markdown 并以 tar.gz 打包OpenAI 则采用 Assistant 指令格式RAG 类适配器还会通过_maybe_chunk_content()调用 rag_chunker.py 中的RAGChunker完成智能切片默认 chunk 512 tokens、保留代码块、按 10% 比例计算重叠确保代码块与上下文在切分后依然完整。各平台的详细支持度可查功能矩阵。为什么值得用速度快据项目官方文档可将数天的数据准备压缩到 15–45 分钟Skill 质量高产出包含示例、模式与指南的 500 行SKILL.mdRAG 就绪切片智能切分保留代码块与上下文完整性多源合一docs GitHub PDF 视频可合并进同一份知识资产一次准备、处处导出无需重复抓取即可导出到 22 个目标久经验证仓库 tests 目录包含数百个测试文件README 声明 3,900 测试通过并内置 68 个工作流预设。五大核心能力拆解1. 文档抓取三层发现 弹性解析对 JavaScript SPA 站点采用三层发现策略sitemap.xml→llms.txt→ 无头浏览器渲染。若站点存在llms.txt则自动使用官方称可提速约 10 倍同时具备智能主题分类以及宽容的 HTML 解析器回退依赖html5lib见 pyproject.toml即使遇到损坏的 markup 也能完成抓取不再产出空结果。相关实现位于 html_scraper.py、browser_renderer.py、llms_txt_parser.py。详见抓取指南与 llms.txt 支持。2. GitHub 与代码库分析C3.x三流架构对代码仓库采用三流three-stream架构代码流AST 解析、设计模式、测试分析、文档流README、docs/、Wiki、社区流issues、PR、元数据。C3.x 流水线提供 9 种语言的 10 个 GoF 模式检测器、从测试提取使用示例、AI 撰写的 how-to 指南、config 提取与架构总览。skill-seekers create ./my-project --preset quick # 1–2 分钟浅层 skill-seekers create ./my-project --preset standard # 均衡默认 skill-seekers create ./my-project --preset comprehensive # 深入、详尽这三个预设由 presets/manager.py 中的PRESETS定义quickdepthsurface无 AI 增强1–2 分钟、standarddepthdeepSKILL.md 级增强5–10 分钟默认、comprehensivedepthfull完整 AI 增强20–60 分钟预设通过PresetManager.apply_preset()将特性开关映射为skip_*参数CLI 显式参数优先于预设值。相关文档见模式检测、How-to 指南、测试示例提取。3. AI 增强单一传输的 API / LOCAL 双模式每一次 AI 调用都经由同一个传输层AgentClient——要么是API 模式Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax要么是LOCAL 模式Claude Code、Kimi Code、Codex、Copilot、OpenCode、自定义代理无 API 费用。深度由--enhance-level 0-3控制代理由--agent选择。agent_client.py 中的AGENT_PRESETS是 LOCAL 模式的唯一事实来源定义了 claude、codex、copilot、opencode、kimi 五个内置代理的启动命令与 stdin/权限跳过能力例如 Claude Code 支持--dangerously-skip-permissions无人值守运行。API 模式则通过AgentClient(modeapi, provider..., model...)统一封装并对超时、限流、鉴权与截断truncation错误做集中分类处理。相关文档增强指南、增强模式、多代理设置。4. 统一多源抓取多来源合并 冲突检测一份 config 可以同时拉取文档、GitHub、PDF、视频等合并为同一份知识资产并内置来源间冲突检测与两两合成pairwise synthesis。这意味着你可以把官方文档与视频教程、社区 issue 合并成一份更完整的 skill。详见统一抓取。5. 视频提取三级转录回退 视觉 OCR支持 YouTube、Vimeo 与本地文件。转录采用三级回退字幕 → YouTube transcript API → 本地 Whisper另提供可选的视觉提取对采样帧上的屏幕代码做 OCR。源码见 video_transcript.py、video_visual.py完整说明见视频指南。6. 质量、同步与规模化质量门禁skill-seekers quality output/react/ --threshold 7对 skill 打分把关变更同步检测文档变更并安排定时重抓与通知流式摄取面向超大文档集的流式stream摄取与增量更新。实现位于 quality_metrics.py、sync、streaming_ingest.py、incremental_updater.py。详见大文档处理与代码质量。MCP 集成让 AI 助手直接调用 Skill 流水线Skill Seekers 自带 MCP 服务器可接入 Claude Code、Cursor、Windsurf、VS Code Cline 与 IntelliJ IDEA# stdio 模式Claude Code、VS Code Cline python -m skill_seekers.mcp.server_fastmcp # HTTP 模式Cursor、Windsurf、IntelliJ python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765接入后只需对助手说一句把 React skill 打包并上传。当前仓库的 FastMCP 实现server_fastmcp.py以装饰器注册工具工具实现全部委托给 mcp/tools 下的模块化文件覆盖 config 工具、抓取工具、打包工具、拆分工具、来源工具、市场工具、向量数据库工具与工作流工具等类别README 徽章标注 40 工具具体数量随版本演进例如当前 FastMCP 模块头部文档标注约 34 个工具可按--help或工具列表核验。客户端接入配置可参考仓库根目录的 example-mcp-config.json。更完整的配置见 MCP 设置、MCP 参考与 HTTP 传输。安装到 19 个 AI 编码代理生成的 skill 可自动安装到各主流 AI 编码代理中skill-seekers install-agent output/react/ --agent cursor skill-seekers install-agent output/react/ --agent all # 安装到所有已识别的代理 skill-seekers install-agent output/react/ --agent cursor --dry-run代理路径作用域Claude Code~/.claude/skills/全局Cursor.cursor/skills/项目VS Code / Copilot.github/skills/项目Amp~/.amp/skills/全局Goose~/.config/goose/skills/全局OpenCode~/.opencode/skills/全局Letta~/.letta/skills/全局Aide~/.aide/skills/全局Windsurf~/.windsurf/skills/全局Neovate~/.neovate/skills/全局Roo Code.roo/skills/项目Cline.cline/skills/项目Aider~/.aider/skills/全局Bolt.bolt/skills/项目Kilo Code.kilo/skills/项目Continue~/.continue/skills/全局Kimi Code~/.kimi/skills/全局IBM Bob.bob/skills/项目这些路径由 install_agent.py 中的AGENT_PATHS字典统一定义区分~/.agent/skills/全局路径与.agent/skills/项目相对路径README 表格将 VS Code 与 Copilot 合并展示源码层面共维护 19 条路径条目。--dry-run可预先查看将写入的位置而不实际安装。上传到 Claudeexport ANTHROPIC_API_KEYsk-ant-... skill-seekers package output/react/ --upload # 打包 上传 skill-seekers upload output/react.zip # 上传已存在的 zip没有 API key打包后手动把output/react.zip上传到 claude.ai 的 skills 页面即可。详见上传指南。工作原理与整体架构五步流水线抓取— 提取每个页面优先检查llms.txt分类— 将内容按主题组织API、指南、教程等增强— AI 撰写带示例的详细SKILL.md打包— 打包为平台就绪的产物上传— 发送到你的 AI 平台可选。架构8 个核心模块 5 个工具模块模块用途CLICoreGit 风格命令分发器、来源自动检测Scrapers共享构建层上的 18 种来源提取器Adaptors统一SkillAdaptorABC 背后的 22 个输出平台格式AnalysisC3.x 代码库流水线、10 个 GoF 模式检测器Enhancement通过统一AgentClient传输层执行 AI 增强Packagingskill 的打包、上传与安装MCPFastMCP 服务器多工具、多工具模块Sync文档变更检测与通知这一模块划分在源码树中可以直接对应src/skill_seekers/cli/CLICore、Scrapers、Analysis、Packaging、Enhancement、src/skill_seekers/cli/adaptors/Adaptors、src/skill_seekers/mcp/MCP、src/skill_seekers/sync/Sync。仓库还提供了 14 张 UML 图UML 架构以及 API 参考、Skill 架构 供深入研读。版本动态v3.9.0 系列README 记录的 v3.9.0 关键改进当前仓库开发版本号已推进至3.10.0.dev0完整历史见 CHANGELOG.md损坏 markup 的 HTML 解析器回退— 严重损坏的页面不再产生空抓取结构良好的页面保持逐字节一致临时故障自动重试— 文档抓取器与 MCPfetch_config对瞬时连接故障与 5xx 做带退避的重试4xx 仍立即失败Whisper 转录回退— 无字幕的本地视频终于能获得真实转录MiniMax 图像 OCR 注册表驱动多模态— 提供商声明自己的线上协议与图像能力中国区发布的 key 可对接正确端点节省 token 的 GitHub issue 默认— GitHub skills 默认不再捆绑已关闭 issue 的完整历史三个服务器启用 env 驱动 CORS— 不再使用带凭据的通配符来源。性能参考据项目官方性能数据数据规模与耗时仅供参考实际取决于网络与机器环境文档规模耗时输出体积小 100 页5–10 分钟~2 MB中100–500 页15–30 分钟~10 MB大500–2,000 页30–60 分钟~40 MB超大10K–40K 页使用stream模式参见大文档处理故障排查skill-seekers doctor # 检查安装与环境 skill-seekers sync-config # 检测 config 漂移常见问题与解决方案见故障排查指南与 TROUBLESHOOTING.md。生态与进一步阅读Skill Seekers 是一个多仓库项目本仓库是核心 CLI 与 MCP 服务器另有网站/文档仓库、社区 config 注册表、GitHub ActionCI/CD、Claude Code 插件、Homebrew tap 等配套仓库。若想贡献官方建议从网站与 configs 仓库入手详见 CONTRIBUTING.md项目采用 MIT 协议见 LICENSE。完整的文档索引见 docs/README.md推荐按需查阅我想……阅读快速上手快速开始 — 3 条命令产出首个 skill理解概念核心概念抓取来源抓取指南 — 全部 18 种来源AI 增强 skill增强指南 · 增强模式导出 skill打包指南创建工作流工作流查找命令CLI 参考 — 全部命令配置Config 格式 · 环境变量MCP 设置MCP 设置 · MCP 参考RAG / IDE 集成LangChain · RAG 流水线 · Cursor · Windsurf · Clineexamples/目录还提供了 Chroma、FAISS、Pinecone、Qdrant、Weaviate、Haystack、LangChain、LlamaIndex 等生态的完整可运行示例可直接对照上手。赞分享人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载相关推荐Skill Seekers Skill Builder用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI SkillSkill Seekers Skill Builder用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill 本文围绕 Skill Seeke人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 快速上手3 步把文档网站与代码仓库转化为可直接使用的 AI 技能Skill Seekers 快速上手3 步把文档网站与代码仓库转化为可直接使用的 AI 技能 本文以仓库中的历史文档 QUICKSTART.md https:人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers革命性AI技能生成平台5分钟将文档网站转化为Claude技能Skill Seekers革命性AI技能生成平台5分钟将文档网站转化为Claude技能 在当今AI技术飞速发展的时代如何快速将现有资源转化为AI可用的技能人工智能AI 应用AI 技能RAGMCP 服务网页爬虫创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表