ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

基于文本的MBTI人格预测:从TF-IDF到FastAPI服务部署

基于文本的MBTI人格预测:从TF-IDF到FastAPI服务部署 简介这份资源是一套基于机器学习的MBTI人格预测系统完整项目面向具备一定Python基础、希望将机器学习落地到文本与行为分析场景的开发者与学习者。项目围绕个体语言和行为模式展开涵盖数据清洗、特征分析处理、人格预测模型构建、参数调优与模型评估并完成用户界面设计与模型集成形成可运行的完整系统。压缩包共约2000个文件以1894个py源码为主辅以39个c、29个h等底层编译文件以及26个txt、7个docx、3个md等说明与文档整体约253.46MB结构完整、便于按模块查阅。资源同时包含项目开发计划、可行性报告等配套材料能帮助读者理解从需求分析到模型部署的全流程。目前已有1818人学习下载适合作为课程设计、毕业设计或机器学习入门实战的参考案例。1. 从一段聊天记录到四个字母MBTI 预测到底在预测什么一个用户填完 60 道量表题系统给出四个字母比如 INTJ。这件事看起来像心理测评落到工程上其实是一个标准的文本多分类问题输入是用户的行为文本或答题记录输出是四个维度上的二分类结果。E/I、S/N、T/F、J/P 各自独立组合起来就是 16 类。很多人第一次做这个项目会直接当成 16 分类来训结果样本一稀疏就崩正确做法是拆成四个二分类器分别预测再拼接。这个系统适合两类人一类是想找一个完整机器学习项目练手的人从数据清洗、特征工程、模型训练到接口部署走一遍另一类是产品侧想快速验证「用文本推断人格倾向」是否可行的人。它不解决心理诊断也不替代专业量表工程目标只有一个——给定一段文本输出四个维度的概率分布并给出可解释的特征贡献。下面按数据、特征、模型、服务、排错五段推进代码用 Python 生态里最常见的组合。2. MBTI 数据集构建与文本清洗的工程细节2.1 数据来源与标签对齐公开的 MBTI 文本数据集常见形式是每行一条用户发言加一个四字母标签比如I am always thinking about the future|||INTJ。拿到手第一件事不是直接喂模型而是检查标签分布。16 类如果每类只有几十条四个二分类器里某些维度会严重不平衡。我一般先统计每个维度的正负比例E/I 和 J/P 通常还算均衡S/N 和 T/F 容易偏。import pandas as pd # 假设原始文件是 posts.txt每行格式文本|||类型 rows [] with open(posts.txt, encodingutf-8) as f: for line in f: text, label line.strip().split(|||) rows.append({text: text, mbti: label}) df pd.DataFrame(rows) # 拆出四个维度每个维度单独做二分类 for i, dim in enumerate([IE, SN, TF, JP]): df[dim] df[mbti].str[i] # 看每个维度的类别分布决定要不要重采样 for dim in [IE, SN, TF, JP]: print(dim, df[dim].value_counts(normalizeTrue).to_dict())这段代码做三件事读原始文件、把四字母拆成四个独立列、打印每个维度的类别比例。str[i]按位置取字母顺序固定为 I/E、S/N、T/F、J/P。如果某个维度某一类低于 30%后面训练时要加class_weightbalanced否则模型会倾向于全预测多数类。2.2 文本清洗的边界MBTI 文本里大量出现口语、缩写、表情符号和 URL。清洗不是越干净越好过度清洗会把「lol」「omg」这类带情绪信号的词删掉反而损失信息。常见做法是保留字母和基本标点去掉 URL、提及和连续重复字符。import re def clean_text(s): s s.lower() s re.sub(rhttp\S, , s) # 去 URL s re.sub(r\w, , s) # 去 提及 s re.sub(r(.)\1{2,}, r\1\1, s) # 连续重复字符压成两个 s re.sub(r[^a-z0-9\s.,!?], , s) # 只留常用字符 s re.sub(r\s, , s).strip() return s df[clean] df[text].apply(clean_text)(.)\1{2,}把三个以上相同字符压成两个保留「sooo」变「soo」这种强调语气。最后一步把非字母数字字符替换成空格避免标点粘连单词。清洗后建议抽样看 20 条确认没有把有意义的内容删光。2.3 训练集与验证集的划分陷阱同一个用户的发言可能分散在多行如果随机划分同一用户的文本会同时出现在训练集和验证集导致验证分数虚高。正确做法是按用户 ID 分组划分没有用户 ID 时至少按文本相似度去重后再分。from sklearn.model_selection import train_test_split # 没有用户 ID 时先按文本去重再分层划分 df df.drop_duplicates(subset[clean]) train, valid train_test_split( df, test_size0.2, random_state42, stratifydf[IE] )stratifydf[IE]保证训练集和验证集在 E/I 维度上比例一致。四个维度可以分别分层但通常选一个主要维度即可。random_state固定后结果可复现团队协作时这一步不能省。3. 用 TF-IDF 和线性模型跑通 MBTI 四维预测基线3.1 特征工程TF-IDF 的参数怎么设文本分类基线首选 TF-IDF 加线性模型原因是可解释、训练快、小数据上不容易过拟合。MBTI 文本通常不长ngram_range设(1,2)能捕捉「not very」这类否定短语min_df设 3 到 5 过滤低频词max_features控制在 2 万以内。from sklearn.feature_extraction.text import TfidfVectorizer from sklearn.linear_model import LogisticRegression from sklearn.pipeline import Pipeline from sklearn.metrics import classification_report def build_model(): return Pipeline([ (tfidf, TfidfVectorizer( ngram_range(1, 2), min_df3, max_features20000, sublinear_tfTrue )), (clf, LogisticRegression( C1.0, max_iter1000, class_weightbalanced )) ]) for dim in [IE, SN, TF, JP]: model build_model() model.fit(train[clean], train[dim]) pred model.predict(valid[clean]) print(dim) print(classification_report(valid[dim], pred))sublinear_tfTrue对词频取对数抑制高频词主导。class_weightbalanced自动按类别频率反比加权解决维度不平衡。C1.0是正则强度倒数值越小正则越强小数据可以试 0.5。四个维度各训一个模型互不干扰。3.2 参数对照不同配置下的验证表现配置ngram_rangemin_df验证集 F1I/E说明A(1,1)30.71基线只看单词B(1,2)30.76加入二元短语C(1,2)50.75过滤更多低频词D(1,3)30.74三元短语引入噪声从表里能看出二元短语带来明显提升三元开始收益递减。min_df从 3 提到 5 影响不大但能减小模型体积。实际项目里我一般固定在配置 B再根据验证集微调C。3.3 把四个二分类器拼成完整 MBTI四个模型各自输出概率取概率大的字母拼成四字母结果。同时保留每个维度的置信度低于阈值的标记为「不确定」。def predict_mbti(text): cleaned clean_text(text) letters [] confidences {} for i, dim in enumerate([IE, SN, TF, JP]): model models[dim] proba model.predict_proba([cleaned])[0] idx proba.argmax() letter model.classes_[idx] letters.append(letter) confidences[dim] round(float(proba[idx]), 3) return .join(letters), confidences result, conf predict_mbti(I enjoy quiet evenings and deep conversations) print(result, conf)models是四个维度训练好的模型字典。predict_proba返回按classes_顺序排列的概率argmax取最大概率下标。置信度低于 0.6 的维度建议在界面上提示「结果仅供参考」避免用户把娱乐性预测当成诊断。4. 从离线模型到可调用服务MBTI 预测接口的落地方式4.1 用 FastAPI 包一层预测接口模型训完不能只躺在 notebook 里。最常见的落地方式是用 FastAPI 暴露一个 POST 接口接收文本返回四字母和置信度。模型在启动时加载一次避免每次请求重复读盘。from fastapi import FastAPI from pydantic import BaseModel import joblib app FastAPI() models {dim: joblib.load(fmodel_{dim}.pkl) for dim in [IE, SN, TF, JP]} class PredictRequest(BaseModel): text: str app.post(/predict) def predict(req: PredictRequest): cleaned clean_text(req.text) letters, conf [], {} for dim in [IE, SN, TF, JP]: proba models[dim].predict_proba([cleaned])[0] idx proba.argmax() letters.append(models[dim].classes_[idx]) conf[dim] round(float(proba[idx]), 3) return {mbti: .join(letters), confidence: conf}joblib.load加载的是训练时用joblib.dump保存的 pipeline包含 TF-IDF 和分类器保证线上和离线特征处理一致。PredictRequest用 Pydantic 做输入校验空文本会在进入模型前被拦截。启动命令是uvicorn main:app --host 0.0.0.0 --port 8000。4.2 批量预测与性能取舍单条预测延迟通常在几毫秒到几十毫秒瓶颈在文本清洗和 TF-IDF 转换。如果要做批量分析不要循环调接口直接在服务内部提供批量方法。app.post(/predict_batch) def predict_batch(texts: list[str]): cleaned [clean_text(t) for t in texts] results [] for i in range(len(cleaned)): letters [] for dim in [IE, SN, TF, JP]: proba models[dim].predict_proba([cleaned[i]])[0] letters.append(models[dim].classes_[proba.argmax()]) results.append(.join(letters)) return {results: results}批量接口把清洗和预测放在一次请求里减少网络往返。如果文本量很大可以把四个维度的预测并行化但线性模型本身很快并行收益有限优先保证代码可读。4.3 模型版本与回滚线上模型一定要带版本号。保存时用model_IE_v1.pkl这种命名接口返回里带上版本字段。新模型上线前先在验证集上跑一遍确认四个维度的 F1 都不低于旧版本再切换。回滚就是把加载路径指回旧文件不需要改代码。注意MBTI 预测结果属于娱乐性推断接口返回中不要使用「诊断」「测评」等词避免用户误解。5. 提升 MBTI 预测效果的三个进阶技巧与排错清单5.1 用字符级特征补足短文本当用户输入只有一句话时词级 TF-IDF 会非常稀疏。字符级 n-gram 能捕捉词形变化和拼写习惯对短文本更稳。常见做法是把词级和字符级特征拼接。from sklearn.pipeline import FeatureUnion feature FeatureUnion([ (word, TfidfVectorizer(ngram_range(1,2), min_df3, max_features20000)), (char, TfidfVectorizer(analyzerchar_wb, ngram_range(2,4), min_df3, max_features10000)) ])char_wb按词边界切字符避免跨词拼接。两个特征块各自归一化后拼接维度控制在 3 万以内。短文本场景下字符级特征通常能带来 2 到 4 个百分点的 F1 提升。5.2 用特征权重做可解释输出线性模型的系数可以直接看哪些词对某个维度贡献大。把系数排序后取 top 词作为预测依据展示给用户比只给四个字母更有说服力。import numpy as np def top_features(model, dim, n10): tfidf model.named_steps[tfidf] clf model.named_steps[clf] names tfidf.get_feature_names_out() coef clf.coef_[0] idx np.argsort(coef) return names[idx[-n:]], names[idx[:n]] pos, neg top_features(models[IE], IE) print(偏向 I 的词:, list(pos)) print(偏向 E 的词:, list(neg))coef_是每个特征对正类的贡献正系数越大越偏向该类。展示时只取 top 10避免信息过载。这一步也能帮你发现数据泄漏比如某个词几乎只在某一类出现可能是标注问题。5.3 排错清单验证分数高但线上效果差现象可能原因检查方法验证 F1 0.9线上乱猜训练验证同用户泄漏按用户分组划分某维度全预测一类类别不平衡未处理看class_weight和分布线上文本清洗后为空清洗规则过严打印清洗前后样本接口延迟高每次请求重载模型启动时加载一次置信度普遍偏低模型欠拟合增大max_features或换模型这张表里最隐蔽的是第一行。同一用户的文本风格高度一致随机划分会让模型记住用户而不是学到通用模式。按用户分组后验证分数通常会掉 5 到 10 个百分点但线上表现更真实。排错时优先看数据划分再看特征和模型参数。本文还有配套的精品资源点击获取
返回列表