ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

一秒跑完表格分类:TabPFN 实战上手指南

一秒跑完表格分类:TabPFN 实战上手指南 一秒跑完表格分类TabPFN 实战上手指南【免费下载链接】TabPFN⚡ TabPFN: Foundation Model for Tabular Data ⚡项目地址: https://gitcode.com/GitHub_Trending/ta/TabPFN用传统机器学习处理表格数据时最耗时的往往不是建模本身而是预处理、调参和反复评估这一整条流水线。TabPFN表格数据基础模型把这条路缩短成几行代码fit(X_train, y_train)之后直接产出预测结果小规模分类与回归问题约1 秒内完成。它兼容 scikit-learn 的fit/predict接口对已有 sklearn 工作流几乎零侵入。 三步完成第一次表格分类预测第一步安装需要 Python 3.10pip install tabpfn第二步跑通最小示例。下面用乳腺癌数据集做一次二分类重点看「fit 即训练、predict 即预测」的两步流程from sklearn.datasets import load_breast_cancer from tabpfn import TabPFNClassifier X, y load_breast_cancer(return_X_yTrue) clf TabPFNClassifier() clf.fit(X[:400], y[:400]) # 首次 fit 会自动下载模型权重然后单次前向完成训练 print(clf.predict(X[400:])) # 直接输出类别标签第三步需要概率时用clf.predict_proba(X_test)拿到的就是校准过的类别概率可直接接入下游的阈值判断或风险分层逻辑。 如何选择合适的模型版本默认使用的是TabPFN-3当前默认版本效果最强。可用版本定义在 src/tabpfn/constants.py 的ModelVersion枚举中V2、V2.5、V2.6、V3、V3.5、V3.5-fast。想固定用某个版本时不必改默认值构造时指定即可代码内指定TabPFNClassifier.create_default_for_version(ModelVersion.V2_6)环境内全局指定设置环境变量TABPFN_MODEL_VERSION配置项定义见 src/tabpfn/settings.py⚠️ 一个容易踩的坑TabPFN-2.5 / 2.6 / 3 的模型权重是非商业许可只有代码和 V2 权重采用 Apache 2.0。如果你的项目要商用请显式选择ModelVersion.V2。 回归任务如何输出预测区间回归器不止给点估计。predict支持output_typequantiles一次调用同时返回多个分位数天然形成预测区间——对「预测值上下会波动多少」这类业务问题非常实用from tabpfn import TabPFNRegressor reg TabPFNRegressor() reg.fit(X_train, y_train) # 同时输出 25% / 50% / 75% 分位数得到点估计加预测区间 low, mid, high reg.predict(X_test, output_typequantiles, quantiles[0.25, 0.5, 0.75])更多参数细节可参考官方示例 examples/tabpfn_for_regression.py 和分布可视化示例 examples/plot_regression_distribution.py。 训练一次后如何保存和复用模型fit产物可以完整落盘推理时直接加载不用重复走 fit 流程。使用 src/tabpfn/model_loading.py 提供的一对函数保存save_fitted_tabpfn_model(reg, Path(model.tabpfn_fit))加载load_fitted_tabpfn_model(Path(model.tabpfn_fit))完整可运行代码见 examples/save_and_load_model.py。⚙️ 避坑指南设备与内存配置TabPFN 对数据的规模敏感部署前先确认两点设备推荐 GPU8GB 显存的旧卡也能流畅运行大数据集建议 16GB。纯 CPU 也有上限——TabPFN-3 默认最多 5000 行样本更早的版本是 1000 行确需 CPU 跑大表时设置TABPFN_ALLOW_CPU_LARGE_DATASETtrue解除限制。fit 模式fit_mode参数控制「训练数据在内存里的存留方式」按需选择fit_mode 取值适用场景fit_preprocessors默认通用默认平衡内存与速度fit_with_cache对同一训练数据反复预测用 KV 缓存换速度low_memory显存/内存紧张时优先保内存batched超大批量推理常用环境变量速查前缀均为TABPFN_完整定义见 src/tabpfn/settings.py变量作用TABPFN_MODEL_CACHE_DIR自定义模型权重的缓存目录TABPFN_MODEL_VERSION切换默认模型版本TABPFN_ALLOW_CPU_LARGE_DATASET允许 CPU 运行大样本数据集TABPFN_MPS_MEMORY_FRACTIONApple Silicon 显存占用比例默认 0.7防系统崩溃TABPFN_MAX_BATCHED_TEST_ROWS缓存模式下单次前向最多处理的测试行数默认 32768最后补一句进阶路径如果在自己的领域数据上精度不够src/tabpfn/finetuning/ 提供了单数据集微调封装FinetunedTabPFNClassifier、FinetunedTabPFNRegressor配合 examples/finetune_classifier.py 即可上手。TabPFN 最适合中小规模表格数据的分类、回归与快速原型场景下一步建议从 examples/ 目录里的完整脚本读起按你的任务类型对照修改即可。【免费下载链接】TabPFN⚡ TabPFN: Foundation Model for Tabular Data ⚡项目地址: https://gitcode.com/GitHub_Trending/ta/TabPFN创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表