ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

CANNBot Skills 使用指南:PyPTO-Gym 的 Agent Skills 体系与四大开发路径插件详解

CANNBot Skills 使用指南:PyPTO-Gym 的 Agent Skills 体系与四大开发路径插件详解 CANNBot Skills 使用指南PyPTO-Gym 的 Agent Skills 体系与四大开发路径插件详解【免费下载链接】pypto-gymPyPTO-Gym 是基于 PyPTO 编程框架构建的算子与模型样例仓库项目地址: https://gitcode.com/cann/pypto-gymCANNBot Skills — PyPTO-Gym 是 PyPTO-Gym 仓库中面向 AI 编程工具Agent的技能模块为昇腾 NPU 上的 PyPTO 与 PyPTO-Pro Tile 算子开发、大模型适配与模型治理提供 30 个可复用技能与 4 个开发路径插件。本文以 cannbot-skills/README.md 为主体结合仓库内各插件的 AGENTS.md、快速入门指南 与 init.sh 源码完整讲解安装方式、开发路径选择、技能清单与 Plugin / Agent / Skill 三层架构读完即可在自己的项目中部署 CANNBot 团队并跑通需求描述 → 算子/模型产物的 Agent 化开发流程。项目概述为 PyPTO 开发者打造的 Agent 技能集CANNBot Skills — PyPTO-Gym是面向 PyPTO 与 PyPTO-Pro Tile 算子开发、大模型适配和模型治理的 CANNBot Agent Skills 模块提供30 个可复用技能与 4 个开发路径插件。其核心定位是将算子开发、模型适配这类需要大量领域知识的工程任务封装为可被 AI 编程 Agent如 OpenCode自动加载的技能Skill与智能体Agent让开发者用自然语言描述需求即可驱动完整的开发流程。面向用户基于 PyPTO 编程框架的昇腾 NPU 算子开发者、模型适配工程师。技能模块与仓库其余部分的关系可从 仓库目录结构 概览cannbot-skills/存放技能与插件src/pypto_gym/存放算子样例实现如 deepseek_v2_lite_chat、qwen3_5 等tests/存放对应测试三者共同构成技能驱动 样例佐证的完整生态。快速开始前置条件在安装 CANNBot Skills 之前需要满足以下环境要求OpenCode AI 编程工具其余受支持工具见下文支持的工具一节Bash、Python 3 运行环境已按 PyPTO-Gym 项目文档完成环境部署含 CANN Toolkit、PyPTO 与 NPU 设备安装选择所需场景后在目标项目目录调用对应插件的安装脚本。以 PyPTO 算子开发为例cd /path/to/your-project bash /path/to/pypto-gym/cannbot-skills/plugins-official/pypto-op-orchestrator/init.sh \ project opencode opencode其他场景PyPTO-Pro 算子开发、模型工具、算子产物校验的安装方式见页面顶部对应的快速上手指南PyPTO 算子开发快速上手指南PyPTO-Pro 算子开发快速上手指南模型工具快速上手指南算子产物校验快速上手指南安装后使用启动 OpenCode直接以自然语言描述需求开发一个 Attention 融合算子 把 Qwen3-1.7B 模型适配到 NPU以 PyPTO 算子开发为例输入帮我开发一个 softmax 算子支持 float16 数据类型shape 主要是 [1,128]、[4,2048]、[32,4096]后CANNBot 会自动启动 7 阶段流程见下文PyPTO 算子开发的 7 阶段状态机。开发路径与核心能力CANNBot Skills 将全部能力收敛为 4 条开发路径每条路径由一个官方插件Plugin作为入口领域 / 路径适用场景入口插件PyPTO 算子开发Stage 1–7 全流程融合算子开发与调优pypto-op-orchestratorPyPTO-Pro 算子开发Stage 1–5 精简流程算子开发与性能优化pypto-pro-op-orchestrator模型适配HF 模型上 NPU、融合算子整网集成、模型格式转换pypto-model-tools算子产物校验KernelBench 评测把关反作弊 精度 性能统一校验pypto-kernel-validatorPyPTO 算子开发7 阶段状态机 8 智能体pypto-op-orchestrator 是 PyPTO 算子开发编排者运行8 智能体PyPTO 算子开发团队驱动Stage 1–7全流程。其 frontmatter 声明了 8 个 subagentpypto-op-planner需求与计划、pypto-op-mathematician数学推导与 Golden、pypto-op-architect设计与接口、pypto-op-coder代码开发、pypto-op-verifier功能验证、pypto-op-debugger问题诊断、pypto-op-optimizer性能调优外加 orchestrator 自身。编排者通过 Task 工具调度子代理绝不亲自执行 Stage 1–7 的任何领域工作这一编排与执行分离的边界是保证团队协作质量的关键设计。核心工作流详见 快速上手指南Stage 1: 需求规划与 API 可行性 → Stage 2: Golden 生成 → Stage 3: 设计与模块接口 → Stage 4: 独立检查与验证准备 → Stage 5: 按模块编码闭环 → Stage 6: 最终 E2E 验证 → Stage 7: 性能调优各阶段职责与产出物Stage 1planner需求规划与 API 可行性产出SPEC.md、API_REPORT.mdStage 2mathematician生成op_golden.py参考实现与GOLDEN_PERF_REPORT.mdStage 3architect一次完成DESIGN.md和eval/module_interfaces.yamlStage 4verifier独立检查设计与接口多模块L1时准备对抗测试文件Stage 5coder / verifier / debugger按模块闭环逐模块完成编码→验证→修复产出modules/、集成op_impl.py、test_op.py与README.mdMEMORY.md从 Stage 5 开始写入Stage 6verifier最终 E2E 精度验证与 layout 校验Stage 7optimizer性能采集、分析与迭代调优verifier 回归确认精度无损生成op_tuning_report.md每个阶段完成门禁校验后才能进入下一阶段支持断点续跑与失败恢复。Stage 5 起通过MEMORY.md人类可读的推理与调试账本与.orchestrator_state.json机器可读的阶段/Phase 状态、重试计数、artifact 哈希双账本记录进度state_transition工具是修改状态文件的唯一途径lint 门禁作为submit_for_verify/complete_phase/complete_stage的副作用自动运行未抛错即 PASS。在custom/op/目录下整个流程会生成如下产出物完整清单见 快速上手指南custom/op/ ├── SPEC.md # 需求规格 ├── API_REPORT.md # API 可行性报告 ├── op_golden.py # Golden 参考实现 ├── GOLDEN_PERF_REPORT.md # Golden 基准性能报告 ├── DESIGN.md # 架构设计文档 ├── op_impl.py # 集成 PyPTO kernel 实现 ├── test_op.py # 端到端测试入口 ├── README.md # 实现说明 ├── MEMORY.md # 阶段协作记录Stage 5 ├── op_tuning_report.md # 性能调优报告Stage 7 ├── .orchestrator_state.json # 流程状态自动维护 ├── eval/ │ ├── module_interfaces.yaml # 模块接口契约 │ ├── test_inputs.py # 对抗测试输入 │ ├── adversarial_suite.json # 对抗测试套件 │ └── adversarial_runner.py # 对抗测试执行器 ├── modules/ # 模块文件L1 路径 └── history_version/ # 版本备份PyPTO-Pro 算子开发默认自主 按需深度编排pypto-pro-op-orchestrator 是 PyPTO-Pro 算子开发入口与 classic 路径的关键差异在于对比维度PyPTO 算子开发PyPTO-Pro 算子开发编程语言PythonPyPTO APIPythonPyPTO-Pro APIimport pypto_pro.language as pl、pl.jit开发流程7 阶段状态机驱动默认自主开发深度编排为 5 阶段流程状态管理.orchestrator_state.jsonstate_transition工具 lint 门禁深度编排使用.orchestrator_state.jsonstate_transition工具 阶段门禁性能调优Stage 7 独立调优阶段Stage 5可比基线、优化循环与证据验收PyPTO-Pro 模式默认由 orchestrator 自主安排开发与验证用户明确要求启用深度编排时agent 自动加载 编排协议执行完整的 Stage 1–5 流程Stage 1: 需求规划与资料索引 → Stage 2: NPU/CPU Golden性能采集可选 → Stage 3: Tile 数据流设计 → Stage 4: Kernel 实现与精度验证 → Stage 5: 可比基线驱动的性能优化与证据验收深度编排的产出物示例详见 快速上手指南SPEC.md、EXPLORE_REPORT.md、PRO_MATERIAL_INDEX.md、{op}_golden.py{op}_golden_cpu.pyCPU FP32 更高精度 Golden、GOLDEN_VALIDATION.json、DESIGN.md、test_{op}.py、PERFORMANCE_CASES.json、PERFORMANCE_REPORT.md、performance.json以及docs/perf/round_NNN/逐轮调优归档。PyPTO-Pro 开发还会通过知识库入口pypto-pro-op-kb的 ROUTER.md 按计算拓扑与目标硬件选择适用的约束与设计模式。模型适配3 个主 skill 8 个支撑 skillpypto-model-tools 是模型迁移、融合算子整网集成与模型格式转换的入口提供 3 个主模型 skill技能说明hf-npu-e2e-workflowHuggingFace 模型到昇腾 NPU 端端迁移pypto-fused-op-integration融合算子入网集成与端到端推理验证pypto-convert-model模型格式互转PyTorch/ONNX/safetensors该插件的init.sh同时安装 8 个算子支撑 skillpypto-intent-understand、pypto-api-explore、pypto-golden-generate、pypto-op-design、pypto-op-develop、pypto-precision-compare、pypto-precision-debug、pypto-op-perf-tune这些 skill 仅由pypto-fused-op-integration在算子开发阶段按需调用不参与 primary 选择不引入状态机或 Subagent因此不计入独立的 30 个技能数。模型插件是独立 skill 集不参与 PyPTO 或 PyPTO-Pro 的算子状态机每次任务只加载一个主 skill。安装后可通过以下命令验证模型 skill 是否就位ls .opencode/skills/hf-npu-e2e-workflow/SKILL.md ls .opencode/skills/pypto-convert-model/SKILL.md ls .opencode/skills/pypto-fused-op-integration/SKILL.md算子产物校验反作弊 精度 性能pypto-kernel-validator 是独立的算子产物校验入口不参与算子开发状态机。唯一执行者是 subagentpypto-kernel-validator自动加载 pypto-kernel-validate 技能对给定op_dir执行反作弊脚本机械检测 LLM 语义审阅精度与 Golden 数值对比性能运行时性能校验产物为output_dir/skill_report.json。其典型调用方为 KernelBench 评测桥接层也可由用户手动触发需提供op_name、op_dir、task_desc_file、output_dir等必需字段。primary 只负责收参、调度与转述final_verdict不亲自执行校验流程。技能清单算子开发技能ops/共 27 个类别技能说明编排入口pypto-orchestration-manual9-agent 团队编排入口需求理解pypto-intent-understand用户需求分析、规格化与歧义澄清方案与计划pypto-op-design、pypto-op-plan算子方案设计与实施计划知识参考pypto-op-knowledge、pypto-api-explore、pypto-docs-search、pypto-memory-template领域知识库、API 速查、文档检索、经验模板复用代码开发pypto-op-develop、pypto-op-design算子核心实现与工程脚手架搭建Golden 与精度pypto-golden-generate、pypto-precision-compare、pypto-precision-debugGolden 生成、精度对比、精度问题排查验证与检视pypto-op-verify、pypto-op-review、pypto-kernel-validate算子功能验证、代码检视与产物校验反作弊 精度 性能性能调优pypto-op-perf-tune算子性能采集、分析与自动调优监控与调试pypto-op-monitor、pypto-general-debug任务进度监控与通用问题诊断Pro 专属pypto-pro-intent-understand、pypto-pro-material-explore、pypto-pro-op-plan、pypto-pro-op-design、pypto-pro-op-develop、pypto-pro-op-perf-tune、pypto-pro-golden-generate、pypto-pro-environment-checkPyPTO-Pro 精简流程的八项专属技能其中部分技能内含可直接查阅的领域资料例如pypto-op-design 的约束与模式库atoms / skeletons 原子模式与骨架模板pypto-op-perf-tune 的共享优化知识pypto-general-debug 的调试手册pypto-api-explore 的算子用法示例覆盖 attention、linear、softmax、moe_routing 等 40 个 PyPTO APIpypto-pro-op-kb 的约束与设计模式库模型适配技能model/共 3 个技能说明hf-npu-e2e-workflowHuggingFace 模型到昇腾 NPU 端到端迁移pypto-fused-op-integration融合算子入网集成与端到端推理验证pypto-convert-model模型格式互转PyTorch/ONNX/safetensors模型插件的init.sh同时安装 8 个算子支撑 skillpypto-intent-understand等仅由pypto-fused-op-integration按需调用不计入独立 skill 数。项目架构目录结构cannbot-skills/ ├── ops/ # 算子 SkillsPyPTO classic PyPTO-Pro ├── model/ # 模型适配与推理优化 Skills └── plugins-official/ # 官方 Plugins开发路径入口含 Agents ├── pypto-op-orchestrator/ # PyPTO classic 算子开发8 Subagent 状态机 ├── pypto-pro-op-orchestrator/ # PyPTO-Pro 算子开发6 Subagent ├── pypto-model-tools/ # 模型适配工具集安装时附带 8 个算子支撑 skill └── pypto-kernel-validator/ # 算子产物校验反作弊 精度 性能单 Subagent三层架构Plugin 编排 AgentsAgents 绑定 SkillsCANNBot Skills 采用清晰的三层架构Plugin应用编排层— 通过AGENTS.md定义各 Agent 协作顺序Agent角色执行层— 承担方案设计、代码开发、代码检视等职责Skill知识能力层— 提供领域知识与工程模板以 PyPTO classic 算子开发为例完整的三层结构如下╔══════════════════════════════════════════════════════════════════════╗ ║ PLUGINS应用编排层 ║ ╠══════════════════════════════════════════════════════════════════════╣ ║ ║ ║ ┌────────────────────────────────────────────────────────────────┐ ║ ║ │ pypto-op-orchestrator │ ║ ║ │ PyPTO Classic Stage 1–7 融合算子开发全流程 │ ║ ║ └──────┬──────┬──────┬──────┬──────┬──────┬──────┬──────┬───────┘ ║ ║ │ │ │ │ │ │ │ │ ║ ╚═════════╪══════╪══════╪══════╪══════╪══════╪══════╪══════╪══════════╝ │ │ │ │ │ │ │ │ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ╔══════════════════════════════════════════════════════════════════════╗ ║ AGENTS角色执行层 ║ ╠══════════════════════════════════════════════════════════════════════╣ ║ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ║ ║ │ planner │ │mathematician│ │ architect │ ║ ║ │ 需求与计划 │ │ 数学推导 │ │设计与接口 │ ║ ║ └─────────────┘ └─────────────┘ └─────────────┘ └─────────────┘ ║ ║ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ║ ║ │ coder │ │ verifier │ │ debugger │ │ optimizer │ ║ ║ │ 代码开发 │ │ 功能验证 │ │ 问题诊断 │ │ 性能调优 │ ║ ║ └─────────────┘ └─────────────┘ └─────────────┘ └─────────────┘ ║ ║ ║ ╚══════════════════════════════════════════════════════════════════════╝ │ │ │ │ │ │ │ │ │ │ │ │ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼ ╔══════════════════════════════════════════════════════════════════════╗ ║ SKILLS知识能力层 ║ ╠══════════════════════════════════════════════════════════════════════╣ ║ ┌─ 编排与知识类 ─────────────────────────────────────────────────┐ ║ ║ │ pypto-orchestration-manual 9-agent 团队编排入口 │ ║ ║ │ pypto-intent-understand 需求分析与规范化 │ ║ ║ │ pypto-op-knowledge 领域知识库 │ ║ ║ │ pypto-api-explore API 速查与用法示例 │ ║ ║ │ pypto-docs-search 文档检索 │ ║ ║ │ pypto-memory-template 经验模板复用 │ ║ ║ └─────────────────────────────────────────────────────────────────┘ ║ ║ ┌─ 开发与工程类 ─────────────────────────────────────────────────┐ ║ ║ │ pypto-op-plan 实施计划 │ ║ ║ │ pypto-op-design 方案设计 / 工程脚手架 │ ║ ║ │ pypto-op-develop 代码开发 │ ║ ║ └─────────────────────────────────────────────────────────────────┘ ║ ║ ┌─ 验证与调优类 ─────────────────────────────────────────────────┐ ║ ║ │ pypto-golden-generate Golden 生成 │ ║ ║ │ pypto-precision-compare 精度对比 │ ║ ║ │ pypto-precision-debug 精度问题排查 │ ║ ║ │ pypto-op-verify 功能验证 │ ║ ║ │ pypto-op-review 代码检视 │ ║ ║ │ pypto-op-perf-tune 性能分析与自动调优 │ ║ ║ └─────────────────────────────────────────────────────────────────┘ ║ ║ ┌─ 监控与调试类 ─────────────────────────────────────────────────┐ ║ ║ │ pypto-op-monitor 任务进度监控 │ ║ ║ │ pypto-general-debug 通用问题诊断 │ ║ ║ └─────────────────────────────────────────────────────────────────┘ ║ ╚══════════════════════════════════════════════════════════════════════╝深入理解安装器init.sh 的参数与安装路径各插件的 init.sh 是统一的安装器其完整用法可从脚本源码的 help 输出中确认。通用调用形式为init.sh [level] [tool] [install_path]参数取值说明levelproject默认或global安装级别项目级或全局级toolopencode默认、claude、trae、cursor、copilot、codearts目标 AI 编程工具install_path任意目录路径项目级安装的目标目录默认当前工作目录典型用法示例来自 init.sh 帮助信息init.sh # 项目级OpenCode init.sh project opencode # 项目级OpenCode init.sh global claude # 全局级Claude Code init.sh project claude # 项目级Claude Code init.sh project trae # 项目级Trae init.sh project cursor # 项目级Cursor init.sh project codearts # 项目级CodeArts init.sh project opencode /path/to/proj # 项目级OpenCode自定义路径各工具对应的安装目录CANNBot 品牌工具项目级安装路径全局级安装路径OpenCode.opencode/{skills,agents}/ 项目根AGENTS.md~/.config/opencode/Claude.claude/{skills,agents}/CLAUDE.md~/.claude/Trae IDE / Plugin / CLI.trae/、.marscode/、.traecli/自动检测~/.trae-cn/、~/.marscode/、~/.traecli/Cursor.cursor/{skills,agents}/AGENTS.md~/.cursor/Copilot.github/{skills,agents}/AGENTS.md~/.copilot/CodeArts.codeartsdoer/{skills,agents}/AGENTS.md~/.codeartsdoer/安装器的实现细节来自 init.sh 源码白名单安装INCLUDED_SKILLS与INCLUDED_AGENT_PATTERN定义本次安装的技能/智能体白名单例如 PyPTO 算子开发会安装pypto-api-explore、pypto-docs-search、pypto-golden-generate等 17 个共享算子技能与全部pypto-op-*agents仅替换白名单内容不影响其他已存在的 skills/agents。软链接复用技能与智能体以软链接方式指向cannbot-skills/ops/共享目录保证仓库内单一事实来源。安全冲突处理safe_install_file在覆盖前自动备份*.bak.时间戳全局模式遇到自定义内容时提供交互式[O]覆盖 / [M]合并 / [S]跳过三选一。幂等与健康检查相同内容跳过安装5 步流程目录软链 → 配置文件 → 工具发现 → 资源边界确认 → 健康检查最后生成cannbot-manifest.json清单并校验 skills/agents/配置文件是否就位。自动门禁边界state_transition工具、写入前 lint 与 Stage/Module 自动硬门禁目前通过 OpenCode 插件提供其他工具的init.sh适配仅安装 skills、agents 与提示词资源不会获得同等的 OpenCode 自动门禁能力详见 PyPTO-Pro 快速上手指南。需要完整状态机和 fail-closed lint 流程时建议使用 OpenCode。安装后可验证# OpenCode应看到对应插件声明的全部 agents opencode agent list # Claude Code / TRAE / Cursor检查安装目录 ls .claude/ # 或 .trae/ / .marscode/ / .traecli/ / .cursor/ # 应看到 skills/ agents/ cannbot-manifest.json技能与仓库样例的呼应关系CANNBot Skills 并非凭空生成的提示词集合其技能描述的开发流程与仓库中的真实算子样例、Golden 与测试一一对应可作为学习与验证的参考算子样例实现src/pypto_gym/ops/pypto_tensor/下按模型组织qwen3_5、kimi_linear_48b_a3b、deepseek_v2_lite_chat 等对应pypto-op-develop/pypto-op-design技能描述的算子实现流程。测试用例tests/ops/下按算子与模型组织如 test_rms_norm_rope.py、test_mla_prolog.py对应pypto-op-verify/pypto-golden-generate技能的验证与 Golden 流程。模型适配modeling/下提供各模型的推理/压测脚本如 ask_Qwen3-1.7B.py与hf-npu-e2e-workflow技能的端到端迁移流程对应。产物校验pypto-kernel-validator的校验协议与tests/utils/compare.py、verify_codegen.py 等工具共同构成精度 性能 反作弊的把关链路。许可证与相关信息CANNBot Skills — PyPTO-Gym 基于CANN Open Software License v2.0见仓库根目录 LICENSE发布面向昇腾 NPU 平台Ascend。本目录随 PyPTO-Gym 主仓同步更新最新变更以主仓提交记录为准。相关资源包括PyPTO 主仓— PyPTO 编程框架与文档本文章不做外部链接展开请从 PyPTO-Gym 主仓 README 获取入口PyPTO-Gym 主仓— 融合算子样例与模型适配即本仓库根目录 README.md许可证— LICENSE基于 CANN Open Software License v2.0使用注意事项由于技术快速迭代部分技能内容可能无法完全适用于所有场景技能与文档持续完善中。自动生成的代码受模型、Skills 能力、语料质量、输入指令等多因素影响无法保证完全精准生成代码仅作辅助研发使用请开发者务必测试验证后再投入使用。在 KernelBench 等评测场景使用pypto-kernel-validator时请遵循其反作弊 精度 性能的统一校验协议确保产物可复现、可审计。【免费下载链接】pypto-gymPyPTO-Gym 是基于 PyPTO 编程框架构建的算子与模型样例仓库项目地址: https://gitcode.com/cann/pypto-gym创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表