ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AI Data Science Team Supervisor 升级路线图:从意图路由到可验证的端到端数据科学工作流

AI Data Science Team Supervisor 升级路线图:从意图路由到可验证的端到端数据科学工作流 AI Data Science Team Supervisor 升级路线图从意图路由到可验证的端到端数据科学工作流【免费下载链接】ai-data-science-teamAn AI-powered data science team of agents to help you perform common data science tasks 10X faster.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-data-science-team本篇技术指南以仓库规划文档 agent_upgrade_plan.md 为主体系统梳理 ai-data-science-team 中 supervisor 主导式数据科学团队Supervisor DS Team的现状、五大关键差距、P0/P1/P2 分级升级方案与验收标准并结合 supervisor_ds_team.py、workflow_planner_agent.py、model_evaluation_agent.py 等源码给出实现级佐证。读完本文你将掌握该团队如何从意图路由式架构演进为计划驱动、步骤可验证、产物标准化、MLflow 全链路可追溯的端到端数据科学工作流并了解哪些升级项已在仓库落地、哪些仍属规划中的增强方向。一、升级目标交付可靠、可追溯的端到端数据科学工作流规划文档开篇即点明 Objective在 supervisor 主导的团队中交付一条可靠的端到端数据科学工作流完整覆盖以下阶段ingest/load数据摄入/加载→ wrangle/clean整理/清洗→ EDA探索性分析→ visualization可视化→ model training (H2O)H2O 模型训练→ evaluation模型评估→ MLflow logging/inspectionMLflow 记录/检视升级计划的关注点非常聚焦——不是增加功能数量而是消除导致输出错误、流程步骤缺失、端到端执行不可靠的差距gaps。这与仓库中 supervisor 的定位一致它不是一个普通的 ReAct Agent而是一个通过 LangGraphStateGraph组织多子代理sub-agents协作的编排器入口与路由均收敛在 make_supervisor_ds_team() 构造的编译图中。当前状态Current State已集成的子代理矩阵文档列出了升级前的团队构成源码 subagent_names 与系统提示词给出了更完整的 12 个 worker 清单Worker核心能力仓库对应实现Data_Loader_Tools_Agent文件发现与加载csv/parquet 等agents/data_loader_tools_agent.pyData_Merge_Agent多数据集确定性合并join/concatsupervisor 内部节点Data_Wrangling_Agentpandas 变换、重塑、编码agents/data_wrangling_agent.pyData_Cleaning_Agent异常处理、缺失值填充agents/data_cleaning_agent.pyEDA_Tools_Agentdescribe / missing / correlation / Sweetviz / D-Taleds_agents/eda_tools_agent.pyData_Visualization_AgentPlotly 代码生成 语义化图表校验agents/data_visualization_agent.pySQL_Database_AgentSQL 生成与执行agents/sql_database_agent.pyFeature_Engineering_Agent特征编码、缩放、交互项、多项式特征agents/feature_engineering_agent.pyH2O_ML_AgentH2O AutoML 训练与评估可选 MLflow 记录ml_agents/h2o_ml_agent.pyMLflow_Tools_AgentMLflow 检视 / UI / registry 操作ml_agents/mlflow_tools_agent.pyModel_Evaluation_Agent持出集上的标准化评估与绘图ml_agents/model_evaluation_agent.pyMLflow_Logging_Agent将工作流产物确定性写入 MLflowsupervisor 内部节点此外文档记录的 Streamlit UX 位于apps/supervisor-ds-team-app/app.py。需要说明的是当前仓库中该应用的路径为 apps/ai-pipeline-studio-app/app.py它同时承担了 supervisor 团队的聊天界面与Analysis Details分析详情面板是理解下文 P0.4、P1.3 升级项落地位置的关键文件。二、五大关键差距症状与根因Gap Analysis文档将问题按症状Symptom→ 根因Root Cause结构化拆解为 5 项。这些差距是升级优先级排序的直接依据也是理解 supervisor 内部为何存在大量防御性逻辑的钥匙。差距 1缺乏显式工作流计划症状多步骤提示词可能提前终止、跳过前置步骤或步骤乱序执行。根因supervisor 的路由是意图/步骤级的intent/step based而不是一个带步骤校验与显式前置依赖的持久化计划durable plan。从源码看路由确实存在两套机制一套是基于正则关键词的启发式意图解析_parse_intent()另一套是 OpenAI function-calling 的supervisor_chainsupervisor_ds_team.py。前者是确定性的但面对复杂组合请求时天然需要计划来串行化步骤这正是 P0.1 WorkflowPlannerAgent 的动机。差距 2问题设定Problem Setup规格化不足症状建模请求缺少对 target / metric / 数据划分splits/ 数据泄漏leakage的明确约定导致失败或低质量结果。根因目标变量发现target discovery与模型规格model spec不是一等公民产物H2O agent 依赖提示词推断。源码中SupervisorDSState为此预留了target_variable字段supervisor_ds_team.py且WorkflowPlannerAgent强制只要出现 model/evaluate 步骤就必须给出 target_variable否则删除相关步骤并提问见下文 P0.1正是对这一差距的直接回应。差距 3评估产物缺失或薄弱症状用户无法信任或横向比较模型缺少一致的混淆矩阵 / ROC / 指标表 / 误差切片error slices。根因没有专职评估 agent结果大多是leaderboardAutoML 排行榜与临时摘要。这一点在仓库中已由 ModelEvaluationAgent 补足见 P0.2其产物结构metrics、confusion_matrix、roc_curve、plotly_graph与文档描述的标准化产物一一对应。差距 4MLflow 未做到端到端症状把一切记录到 MLflow执行不一致图表、EDA、数据集不能可靠记录。根因MLflow 工具主要支持检视/UI/predict缺少记录 params/metrics/tables/figures 的日志工具。仓库的 tools/mlflow.py 已补齐这一缺口见 P0.3工具清单与文档建议完全吻合。差距 5Streamlit 中 EDA 报告渲染不完整症状Sweetviz / D-Tale 输出不可见、无法嵌入页面用户难以检视报告。根因Streamlit UI 只渲染 Plotly JSON 与 JSON 数据块不处理 HTML 报告产物。升级后的渲染方案在 apps/ai-pipeline-studio-app/app.py 中已有落地通过_extract_eda_reports()从 artifacts 提取sweetviz_report_file与dtale_url对 Sweetviz 报告提供打开/下载入口对 D-Tale 提供跳转链接详见 P1.3。三、P0 — 必做项打通真正的端到端工作流P0 是解锁端到端工作流的前提共 4 项。以下逐项结合文档方案与源码实现展开。P0.1 WorkflowPlannerAgent新 Agent文档方案输出一个结构化计划对象包含有序步骤、前置依赖、所需输入。示例步骤load, validate_schema, clean, eda_summary, viz_requests, feature_engineering, train, evaluate, log_mlflow。supervisor 按序执行步骤并用确定性检查标记完成例如data_cleaned 存在且非空。源码实现agents/workflow_planner_agent.py 中WorkflowPlannerAgent已实现其职责边界清晰——只产出计划不执行任何数据任务输出 schema 固定为{steps: [...], target_variable: str|null, questions: [...], notes: [...]}可规划的步骤白名单共 13 个list_files, load, merge, sql, wrangle, clean, eda, viz, feature, model, evaluate, mlflow_log, mlflow_tools步骤必须去重、按序、且全部来自白名单_safe_json_loads 白名单过滤逻辑目标变量强制规则只要步骤包含model或evaluate就必须给出target_variable缺失时自动删除这两个依赖步骤并插入提问What is the target column name for modeling/evaluation (e.g.,Churn)?workflow_planner_agent.py支持proactive_workflow_mode上下文开启时允许对宽泛请求如analyzefull workflow提出合理端到端方案关闭时只规划显式请求的步骤及其前置依赖针对model一词的歧义产品bike model vs ML 模型在系统提示词中做了专门约束。在 supervisor 侧make_supervisor_ds_team()通过可选参数workflow_planner_agentNone接入规划器supervisor_ds_team.py。路由节点supervisor_node中当满足主动模式 / 用户要求 workflow / model / evaluate / mlflow 相关 / 意图步骤数 ≥ 3任一条件时即调用规划器并把计划缓存到状态字段workflow_plan/workflow_plan_request_id按用户消息 ID 隔离避免跨请求串扰若规划器返回 questions 且无可行步骤则暂停执行并向用户提问supervisor_ds_team.py。P0.2 ModelEvaluationAgent新 Agent文档方案输入为训练好的模型产物 数据集 target 划分策略输出为标准化产物分类的指标表、混淆矩阵/ROC回归的残差、误差切片评估结果必须进入最终回答并可选择记录到 MLflow。源码实现ModelEvaluationAgent 采用确定性评估而非 LLM 自由发挥任务类型推断_infer_task_type()bool/object/categorical 类型或整数且唯一值 ≤ 20 判为分类否则回归正类选择_choose_positive_label()按yes / true / 1 / churn / positive优先级匹配兜底取最后一个标签评估数据源优先使用交叉验证持出预测cross_validation_holdout_predictions()无泄漏不可用时回退为随机划分train_test_splittest_size0.2, random_state42分类按stratifyy并在结果中明确标注evaluation_sourcerandom_split_in_sample及可能乐观的提示分类产物accuracy / precision / recall / f1 / auc指标、混淆矩阵Plotly Heatmap、ROC 曲线AUC 标注 Chance 虚线默认图取混淆矩阵回归产物rmse / mae / r2指标与Residuals vs Predicted散点图输出统一写入eval_artifacts含target_variable / task_type / test_size / model_path / best_model_id / evaluation_source / metrics等并附带plotly_graph便于 Streamlit 直接渲染。supervisor 侧由node_eval节点调用supervisor_ds_team.py优先取feature_data否则取当前激活数据cleaned → wrangled → sql → raw模型产物取自artifacts[h2o]目标变量取自状态字段target_variable并把eval_artifacts与图写入artifacts[eval]。P0.3 扩展 MLflow 工具以支持记录升级文档方案新增mlflow_log_params / mlflow_log_metrics / mlflow_log_table / mlflow_log_artifact / mlflow_set_tags / mlflow_log_figure等工具目标是让记录由工具确定性完成而非依赖 LLM 自由写代码。源码实现tools/mlflow.py 中上述工具已全部实现均以tool(response_formatcontent_and_artifact)封装工具底层调用关键行为mlflow_set_tagsmlflow.set_tags未传 run_id 时复用活动 run 或按 experiment 新建mlflow_log_paramsmlflow.log_params批量记录参数mlflow_log_metricsmlflow.log_metrics先做数值化兜底float(v)失败则跳过支持stepmlflow_log_tablemlflow.log_table接受任何可转 pandas DataFrame 的对象artifact_file如tables/preview.jsonmlflow_log_dictmlflow.log_dict记录 JSON 可序列化字典mlflow_log_figuremlflow.log_figure接受 Plotly dict解析失败时回退log_dictmlflow_log_artifactmlflow.log_artifact(s)文件用 log_artifact目录用 log_artifacts所有工具共享_resolve_active_run()活动 run 解析器可指定run_id / tracking_uri / registry_uri / experiment_name会自动结束不匹配的活动 run 并按需新建/复用。配合既有的mlflow_search_experiments / mlflow_search_runs / mlflow_launch_ui等检视工具MLflow 从只读检视扩展为可确定性写入。supervisor 侧的node_mlflow_logsupervisor_ds_team.py进一步把整条流水线产物落到单个 run尝试复用 H2O 训练产生的mlflow_run_id从artifacts[h2o]多层解析记录数据集预览tables/data_preview.json前 200 行与 schematables/schema.json通过 utils/pipeline.py 的build_pipeline_snapshot()生成数据血缘pipeline/pipeline_spec.json与可复现脚本pipeline/pipeline_repro.py并写入pipeline_hashtag记录可视化plots/viz.json/plots/viz.html记录评估产物evaluation/eval_artifacts.json、评估指标mlflow.log_metrics与评估图evaluation/eval_plot.html返回{run_id: ..., logged: {tables, figures, dicts, metrics}}汇总清单。这正是文档验收标准中run 内含 metrics params 至少一张表 一张图 模型产物的落地形态。P0.4 Supervisor Workflow Mode 开关App Supervisor文档方案UI 增加一个Proactive workflow mode开关默认关闭。开启时即使请求描述不完整supervisor 也允许提出并运行完整工作流并在缺失必要输入如 target 列时向用户提问。源码实现开关在 apps/ai-pipeline-studio-app/app.py 以st.checkbox(Proactive workflow mode)呈现默认未勾选与文档默认关闭一致存入st.session_state[proactive_workflow_mode]并随artifacts.config传入 supervisor。在 supervisor_node 中读取proactive_workflow_mode配置开启时_parse_intent会自动把clean / eda / viz / model / evaluate置为 True并提高使用WorkflowPlannerAgent的触发概率规划器在主动模式下也可对宽泛请求提出端到端方案。四、P1 — 高价值项质量与可靠性提升P1.1 数据集注册表与选择 UX升级文档方案在 supervisor 状态中维护数据集注册表datasets[{name}] {data, schema, provenance}与active_dataset_id显式路由使用数据集 X的请求防止数据集被静默切换。源码实现SupervisorDSState已内置datasets: Dict[str, Any]、active_dataset_id、active_data_key字段supervisor_ds_team.py。_ensure_dataset_registry()supervisor_ds_team.py维护注册表每条目含stageraw/sql/wrangled/cleaned/feature、created_ts、指纹与 schema 元数据常量DATASET_REGISTRY_MAX10、DATASET_FINGERPRINT_MAX_ROWS200、DATASET_SCHEMA_MAX_COLS200控制规模。supervisor_node 会解析use dataset X / switch dataset / use cleaned / use sql等指令完成显式切换按名称、序号或 stage 匹配并以 AI 消息回执Switched active dataset to ...而不是把切换交给 LLM 隐式决定。下游节点通过_get_active_data()按data_cleaned → data_wrangled → data_sql → data_raw → feature_data的优先级取当前激活数据避免旧数据出图/出模型的脏读问题。P1.2 DataQualityAgent新 Agent可选但 ROI 高文档方案输出 schema/类型推断、缺失率规则、泄漏检查ID 列、基数检查、目标变量可行性检查可把关建模给出数据尚未就绪因为……的结论。从源码结构看该 Agent 在仓库中尚未单独成文件属于规划项但其部分检查能力已散布在现有实现中——例如_dataset_meta()的 schema/指纹提取、ModelEvaluationAgent对 target 列存在性与任务类型的校验model_evaluation_agent.py。文章仅将 P1.2 视为规划中的高 ROI 增强方向不做超出仓库证据的描述。P1.3 Streamlit 中 EDA 报告渲染升级文档方案检测 Sweetviz / D-Tale 输出并用st.components.v1.html(...)渲染或提供下载链接在Analysis Details中新增报告专用 Tab。源码实现apps/ai-pipeline-studio-app/app.py 已实现对应逻辑从detail[eda_reports]读取sweetviz_report_file与dtale_urlSweetviz 报告显示文件路径并提供下载按钮读取文件内容后st.download_buttonD-Tale 显示Open D-Tale链接两者都缺失时提示 No EDA reports returned.。报告提取逻辑位于_extract_eda_reports()app.py逐层解析generate_sweetviz_report/generate_dtale_report产物并规整为eda_reports字典页面底部另有独立的 Analysis Details 区块app.py用于展示各步骤详情。P1.4 更强的完成度检查升级文档方案用显式检查替代 LLM 的看起来完成了判断——每步要求数据存在、图类型与请求匹配、模型指标存在、MLflow run id 存在。源码实现supervisor 维护handled_steps与attempted_steps两个按用户请求 ID 隔离的状态字典supervisor_ds_team.py。每个 worker 返回后supervisor 依据确定性条件标记步骤完成例如load_loader_loaded_dataset()判定 loader artifacts 中确有statusok且data非空区分真加载与仅列目录cleandata_cleaned is not Noneedaeda_artifacts is not Nonevizviz_graph is not Nonemodelmodel_info is not Noneevaluateeval_artifacts is not Nonemlflow_logmlflow_artifacts is not None。完整映射见 supervisor_ds_team.py。同时attempted_steps用于防死循环同一请求内某步骤已尝试但未完成时直接 FINISH避免无限重试。五、P2 — 锦上添花打磨与规模化文档列出的三项 P2 在仓库中目前属于规划方向本文如实标注其规划性质任务队列 / 长任务处理支持更长工作流的进度更新与取消。当前 supervisor 为同步图执行尚无队列化执行器。实验对比与模型注册工作流如对比最近 5 次 runpromote best to stagingregister modelserve via MLflow。仓库已具备部分底层能力——tools/mlflow.py 提供mlflow_search_runs / mlflow_list_registered_models / mlflow_transition_model_version_stage等工具但对比/晋升/服务的编排级工作流仍需在 supervisor 层面封装。可复现包Reproducibility Packs自动导出含每步执行代码与元数据的 notebook/脚本。当前 node_mlflow_log 已能将pipeline_repro.py作为 artifact 记录到 MLflow可视作该方向的雏形。六、建议的集成顺序Milestones文档给出的里程碑如下是团队逐步演进的路线图P0.1–P0.2将WorkflowPlannerAgent与ModelEvaluationAgent接入 supervisor 图P0.3新增 MLflow 记录工具由 supervisor 确定性记录表/图/指标P0.4在 Streamlit 增加 Workflow Mode 开关并配套 supervisor 行为门控P1.1–P1.3数据集注册表 DataQuality EDA 报告渲染P1.4–P2加固与高级 MLflow registry 工作流。从当前仓库状态看第 1、2、3 步与第 4 步中的数据集注册表、EDA 报告渲染均已落地见上文源码证据P1.2 DataQualityAgent 与 P2 三项仍属规划增强。七、验收标准Definition of Done文档给出了可操作的验收场景这也是衡量升级是否成功的金标准。单个提示词Load churn, clean, EDA, plot MonthlyCharges by Churn, train a churn model, evaluate it, and log everything to MLflow必须满足四条验收条件无消息顺序问题整条流程按序执行不因消息历史混乱而中断图表类型正确生成与请求匹配的图如按 Churn 分组的 MonthlyCharges 箱线图/分布图返回评估产物不只是 AutoML leaderboard而是标准化 metrics 表、混淆矩阵/ROC 等MLflow 记录完整单个 run 内包含 metrics params 至少一张表 一张图 模型产物。对照 examples/teams_of_agents/supervisor_ds_team.ipynb 的组装代码你可以通过如下方式构造带规划器与评估器的完整团队模型可替换为任意 ChatOpenAI 兼容实例from langchain_openai import ChatOpenAI from ai_data_science_team.agents import WorkflowPlannerAgent, DataLoaderToolsAgent, DataWranglingAgent from ai_data_science_team.ml_agents import H2OMLAgent, MLflowToolsAgent, ModelEvaluationAgent from ai_data_science_team.multiagents.supervisor_ds_team import SupervisorDSTeam llm ChatOpenAI(modelgpt-4.1-mini) workflow_planner_agent WorkflowPlannerAgent(llm) model_evaluation_agent ModelEvaluationAgent() team SupervisorDSTeam( modelllm, workflow_planner_agentworkflow_planner_agent, data_loader_agentDataLoaderToolsAgent(llm), data_wrangling_agentDataWranglingAgent(modelllm), # ...其余子代理按需注入cleaning/eda/viz/sql/feature/h2o/mlflow_tools h2o_ml_agentH2OMLAgent(modelllm), mlflow_tools_agentMLflowToolsAgent(modelllm), model_evaluation_agentmodel_evaluation_agent, temperature1.0, )运行team.invoke_agent(user_instructionsLoad data/churn_data.csv, clean, EDA, plot MonthlyCharges by Churn, train a churn model, evaluate it, and log everything to MLflow)后可在流式输出中观察---SUPERVISOR---的逐步路由日志next_stepload - Data_Loader_Tools_Agent等并在team.response的 artifacts 中检视eval_artifacts、mlflow_artifactsrun_id 与 logged 清单。实验数据可使用仓库自带的 data/churn_data.csv。此外planning_docs/supervisor/supervisor_team_plan.md 记录了更早期的团队搭建计划与开放问题沙箱执行是否默认开启、是否增加轻量总结节点、是否用 MemorySaver 做短期记忆可作为理解演进脉络的补充资料。八、升级计划落地现状速览升级项优先级仓库落地状态关键证据WorkflowPlannerAgentP0.1✅ 已实现agents/workflow_planner_agent.pyModelEvaluationAgentP0.2✅ 已实现ml_agents/model_evaluation_agent.pyMLflow 记录工具P0.3✅ 已实现tools/mlflow.pyWorkflow Mode 开关P0.4✅ 已实现apps/ai-pipeline-studio-app/app.py数据集注册表P1.1✅ 已实现supervisor_ds_team.pyDataQualityAgentP1.2⏳ 规划中部分检查能力散见于现有 agentEDA 报告渲染P1.3✅ 已实现apps/ai-pipeline-studio-app/app.py完成度检查P1.4✅ 已实现handled_steps/attempted_steps机制任务队列 / 实验对比 / 可复现包P2⏳ 规划中可复现脚本雏形见node_mlflow_log综上所述agent_upgrade_plan.md 既是该团队从路由式多智能体走向计划驱动、可验证端到端工作流的设计蓝图也是一份与源码高度同步的演进日志文档定义的差距与方案绝大多数已在SupervisorDSTeam及其子代理中转化为可运行的确定性逻辑。理解这份计划你就能快速掌握 supervisor 团队的状态设计workflow_plan、datasets、handled_steps、eval_artifacts、mlflow_artifacts、路由与防死循环机制以及 MLflow 全链路可追溯的落地姿势为在此基础上扩展自己的数据科学多智能体工作流打下基础。【免费下载链接】ai-data-science-teamAn AI-powered data science team of agents to help you perform common data science tasks 10X faster.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-data-science-team创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表