
3步搭好本地文献分析系统Xinference模型部署与处理流程教程【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferenceXinference 是一个开源推理框架可以把对话大模型和嵌入模型部署在你的本地机器上并提供统一的 API 接口。本文带你用 3 步搭一个能跑在自己电脑上的文献分析系统适合新手和有本地化处理文档需求的用户。它能帮你做什么Xinference 是一个统一的模型推理服务框架你在 Web 界面或代码里启动模型它负责底层加载、加速和接口封装。对你来说它提供这样几项能力支持 LLM、embedding嵌入把文字变成一串数字表示语义、rerank重排序、音频等模型类型统一入口管理提供 transformers、vllm、llama_cpp 等多种推理引擎可按你的硬件自选模型启动后暴露 OpenAI 风格的接口现有代码基本不用改对接方式支持 supervisor worker 的分布式部署机器不够用时可以横向扩展。对文献处理这个场景你只需要两个模型配合一个嵌入模型负责把文字变向量一个对话模型负责生成摘要。环境准备与首次启动最低要求Python 3.10 以上、约 20GB 可用磁盘要放模型权重、有 GPU 体验更好但用 CPU 跑小模型也可以。详细系统要求见官方安装文档。第一步安装依赖pip install xinference[all] # 一次装齐各模型类型的依赖方括号里的all表示全量依赖。如果你只想用 llama_cpp 引擎在 CPU 上跑装xinference[llama_cpp]就够了。第二步启动服务xinference --host 127.0.0.1 --port 9997看到日志显示服务就绪后用浏览器打开http://127.0.0.1:9997。页面能打开、能看到模型列表界面说明服务已正常。首次启动模型时会自动从模型仓库下载权重控制台的进度条就是这一步速度取决于你的网络。模型选择与启动现在用代码启动两个模型。选哪个模型可以先在 Web 界面里浏览这里直接给可用且内置的名称from xinference.client import Client client Client(http://127.0.0.1:9997) emb_uid client.launch_model(model_namebge-base-en-v1.5, model_typeembedding) llm_uid client.launch_model(model_nameHuatuoGPT-o1-LLaMA-3.1, model_enginevllm, quantizationnone)参数说明每个只说一件事bge-base-en-v1.5官方内置的英文嵌入模型输出 768 维向量768 维指每段文字变成一个含 768 个数字的向量HuatuoGPT-o1-LLaMA-3.1Xinference 内置的医疗领域对话模型8B 参数规模model_engine推理引擎vllm 吞吐更高但要求 Linux 加 CUDA 显卡quantization量化格式作用是用更低的精度换更少显存内置 pytorch 格式选none即可。launch_model返回的uid是模型在服务器上的唯一编号后续所有调用都靠它定位模型。用client.get_model(uid)拿到句柄就能调嵌入和对话接口了。文献处理全流程文档加载与分块大模型一次能处理的文字长度有限长文献要先切成块再喂进去from pypdf import PdfReader text \n.join(p.extract_text() or for p in PdfReader(paper.pdf).pages) chunks [text[i:i1500] for i in range(0, len(text), 1500)] # 每块约1500字符这一步的产出是一个文本块列表后面逐个送进模型。向量化与摘要生成emb client.get_model(emb_uid) vectors emb.create_embedding(chunks) # 每个文本块转成一个向量 completion client.get_model(llm_uid).chat( messages[{role: user, content: f请用3点概括以下文献内容\n{chunks[0]}}]) print(completion[choices][0][message][content])产出是两样东西一组向量可存进任意向量数据库之后用语义检索快速定位相关段落一份三点式摘要就是你这次处理的目标结果。到这里一条PDF 进、向量加摘要出的最小链路就跑通了。使用文档里有更多接口示例。实测效果与常见坑效果说明示例口径在本地 Linux 加 CUDA 显卡的机器上跑上面的流程8B 对话模型加载完成后对单个 1500 字符文本块的摘要请求是秒级返回输出结构化的三点摘要bge-base-en-v1.5 对该长度文本块嵌入正常。具体耗时随硬件不同请以你机器上的实测为准本文不引用未经实测的数字。常见问题 FAQ首次启动特别慢 正常现象。权重是首次自动下载等它下完第二次启动直接读本地缓存会快很多。显存不足启动失败把model_engine换成transformers或llama_cpp或换更小参数的模型别硬上 70B。选了 vllm 却起不来按官方安装文档的说明vllm 引擎需要 Linux 系统和至少一张 CUDA 显卡Mac 用户建议用transformers或mlx引擎。资源导航安装与环境doc/source/getting_started/installation.rst使用教程doc/source/getting_started/using_xinference.rst核心模型代码目录xinference/model/分布式部署doc/source/user_guide/distributed_inference.rst从启动服务到拿到第一份摘要整个过程不到十行代码。把这条链路跑通之后你可以顺着 rerank 排序、多文档问答等方向继续扩展。祝你部署顺利。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考