ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

3行代码训练AutoGluon文档分类模型:从扫描件到PDF自动归档的完整指南

3行代码训练AutoGluon文档分类模型:从扫描件到PDF自动归档的完整指南 3行代码训练AutoGluon文档分类模型从扫描件到PDF自动归档的完整指南【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluon发票、合同、表单扫描件堆积成山靠人眼归档费时又易错。AutoGluon 多模态模块AutoMM提供了一条捷径自动完成 OCR 文字识别融合文本、版面与视觉特征几行代码就能训练出一个可落地的 AutoGluon 文档分类器10分钟从数据到预测。价值点速览零手写 OCR 管线训练时自动识别文档中的印刷/手写文字无需自己搭 Tesseract 调用链多模态特征融合同时利用识别出的文本、版面位置layout和视觉信息做分类预训练文档模型内置 LayoutLM 系列等专为文档设计的基座模型小样本也能快速见效一条接口搞定全流程MultiModalPredictor完成训练、评估、预测、概率输出和特征提取扫描件与 PDF 通吃图片文档和 PDF 文件走同一套 APIAutoMM 自动识别格式并做相应处理一条命令装好文档分类依赖文档分类依赖 OCR 引擎 Tesseract先在系统层装好再安装 Python 包即可# 安装 AutoGluon 多模态模块 pip install autogluon.multimodal # Ubuntu 系统安装 OCR 引擎 sudo apt install tesseract-ocr不同系统的差异只有 Tesseract 这一步系统安装方式Ubuntu / Debiansudo apt install tesseract-ocrmacOSbrew install tesseract或sudo port install tesseractWindows安装 UB-Mannheim 提供的安装包并将 tesseract-OCR 目录加入 PATH完整的系统依赖说明见官方前置文档 docs/tutorials/multimodal/document_prediction/index.md。三步训练你的扫描件分类模型以下路径来自官方教程 document_classification.ipynb数据集是 RVL-CDIP 的采样子集约 100 份扫描文档覆盖预算表budget、邮件email、表单form三类。第一步下载数据并按 8:2 划分import pandas as pd from autogluon.core.utils.loaders import load_zip # 下载 RVL-CDIP 扫描件样本并解压含 doc_path 列的 CSV load_zip.unzip(https://automl-mm-bench.s3.amazonaws.com/doc_classification/rvl_cdip_sample.zip, unzip_dir./ag_automm_tutorial_doc_classifier) data pd.read_csv(./ag_automm_tutorial_doc_classifier/rvl_cdip_sample/rvl_cdip_train_data.csv) train_data data.sample(frac0.8, random_state200) # 80% 训练 test_data data.drop(train_data.index) # 20% 评估数据表里每行就两个关键列文档相对路径doc_path和目标类别label。训练前可用教程中的path_expander把相对路径展开为绝对路径见 autogluon.multimodal.utils.misc。第二步3 行代码完成训练、评估与预测from autogluon.multimodal import MultiModalPredictor predictor MultiModalPredictor(labellabel) # 指定类别列 predictor.fit(train_datatrain_data, hyperparameters{model.document_transformer.checkpoint_name: microsoft/layoutlm-base-uncased}, # 文档基座模型 time_limit120) # 训练时长上限秒 predictor.evaluate(test_data, metrics[accuracy]) # 测试集准确率 predictor.predict({doc_path: [path/to/new.doc]}) # 预测新文档fit期间 AutoMM 会自动完成文字识别、特征提取和 LayoutLM 微调time_limit120表示最多训 2 分钟——时间预算给得越多精度上限越高。第三步按需取概率或文档向量predictor.predict_proba({doc_path: [p]})输出各类别概率便于做置信度筛选predictor.extract_embedding({doc_path: [p]})输出整篇文档的 N 维向量维度随模型而定可直接用于相似度检索、聚类归档、重复文档检测核心实现位于 multimodal/src/autogluon/multimodal/ 多模态模块预测器入口是MultiModalPredictor。进阶场景多页 PDF 文档分类扫描件教程换到 PDF 上API 完全不变差异集中在数据与处理细节官方教程见 pdf_classification.ipynb。以美国历史文档 vs 其他的 PDF 数据集pdf_docs_small.zip为例对比项扫描件分类PDF 文档分类数据来源图像文件预算表/邮件/表单PDF 文件data.csv提供doc_path格式适配直接读图AutoMM 自动检测 PDF转成模型可识别格式文字获取OCR 识别检测并识别 PDF 内嵌/渲染文本训练调用predictor.fit(...)完全相同可替换checkpoint_name两个实践要点基座模型可按任务切换model.document_transformer.checkpoint_name支持layoutlmv3、layoutlmv2、layoutlm-base-uncased、layoutxlm等文档专用模型也兼容bert、deberta等纯文本模型多语言文档可试layoutxlm路径必须可定位PDF 的doc_path同样要用path_expander展开否则MultiModalPredictor找不到文件走向生产特征复用与模型定制特征复用extract_embedding提取的文档向量可接入相似度匹配与聚类管线把分类扩展成合同相似检索重复件去重模型定制学习率、训练轮数、序列长度如max_seq_length等均可通过hyperparameters覆盖完整清单见 customization.ipynb任务扩展同一套多模态接口支持命名实体识别NER等文档理解任务标签数据可用表格化格式管理参考示例 examples/automm/label_studio_export_reader/小结与资源清单从一条安装命令到 3 行训练代码AutoGluon 文档分类把 OCR、特征融合、模型微调全部收进了fit调用里扫描件走快速通道PDF 只需换数据接口不变。学习资源文档预测教程入口docs/tutorials/multimodal/document_prediction/index.md扫描件分类完整示例document_classification.ipynbPDF 分类完整示例pdf_classification.ipynb多模态模块源码multimodal/src/autogluon/multimodal/AutoMM 更多示例蒸馏、ONNX 导出等examples/automm/下一步可以试试用time_limit拉长训练时长观察测试集准确率随时间预算的变化曲线。【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluon创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表