首页
/
工具详情
Xinference平台使用指南
一、平台介绍
全称
Xorbits Inference
定义
开源本地/私有化大模型推理服务框架
核心优势
- 部署灵活:支持单机或集群均可部署,内置 WebUI。
- 接口统一:对外全兼容 OpenAI 接口,便于迁移。
- 模型统一:统一托管 LLM、多模态、语音、向量、重排模型,替代 Ollama+vLLM 多套工具。
- 数据安全:数据完全本地不出内网,主打企业私有化 AI 底座。
二、核心主要功能
- 全品类模型托管 支持 300+ 开源模型(如通义千问、Llama、GLM、Whisper、LLaVA 等),涵盖 LLM、图文多模态、语音 ASR/TTS、Embedding、Rerank 等场景。
- 多推理引擎加速 支持 vLLM、SGLang、llama.cpp、Transformers 等引擎。内置 AWQ、GPTQ、FP8 量化技术,具备分离式 Prefill-Decode 以提升吞吐量。
- OpenAI 兼容统一 API 提供
/v1/chat/completions、音频、向量等接口。原有 GPT 代码仅需修改base_url即可无缝迁移。 - 分布式集群调度 支持多机异构部署(如 GPU、昇腾、M 系列苹果芯片混布),兼容 K8s 并支持弹性扩缩容。
- 配套开发能力 提供 Web 可视化管理、函数调用 Function Calling、基础监控指标。支持 Docker 一键部署,并可无缝对接 LangChain、Dify、FlowUs 等平台。
- 企业级商业特性 具备多租户、权限管控、私有模型仓库、SLA 保障、GDPR/HIPAA 合规认证,以及国产硬件适配。
三、适用人群
✅ 适合使用
- 个人开发者/学生:适合本地跑开源模型做测试、搭建 RAG 原型。
- AI 研发/算法团队:作为统一推理底座,用一套 API 管理全部模型。
- 中小企业:适合私有化知识库、客服 AI、离线业务,规避公有 API 成本与数据泄露风险。
- MLOps 运维:适合搭建本地推理集群,统一调度多 GPU 资源。
- 合规行业(金融/政务):满足数据禁止出内网场景的安全需求。
❌ 不适合使用
- 无 GPU/低配设备:无 GPU 或低配轻薄本运行 7B+ 大模型时,速度极差。
- 纯云端需求用户:只想开箱即用云端对话、无本地部署能力的普通用户。
- 超大规模高并发:超大规模公有云高并发商用场景,建议优先选择专业云推理服务。
四、免费&付费方案
📚 定价官方页面
- 国际站:https://xinference.co/pricing
- 国内中文站:https://xinference.cn/pricing
1. 开源免费版(永久免费)
- 授权:MIT 开源,个人/小型商用均可自由部署。
- 功能:单机部署、基础 WebUI、全部推理引擎、OpenAI API、社区文档支持。
- 调用额度:无调用额度限制。
- 限制:无集群支持、无权限管控、无商业售后、不支持国产 NPU 深度适配、无 SLA 保障。
2. 企业单机商业版(付费授权)
- 适用:单机生产环境。
- 功能:权限管理、单点登录、国产芯片深度适配、7×12 技术支持、安全审计、私有模型库。
- 限制:不支持多机分布式集群扩展。
3. 企业集群商业版(付费授权)
- 适用:大型生产环境、多机集群。
- 功能:
- 全功能 + 多机分布式、弹性伸缩。
- 高可用 Supervisor、K8s Helm、专属技术顾问。
- SLA 保障、多租户隔离、合规审计。
五、快速使用步骤
1. 安装(三选一)
方式一:pip 完整安装(推荐)
bash
pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple
方式二:Docker 部署
bash
docker pull xprobe/xinference:latest-cu129 docker run -d -p 9997:9997 xprobe/xinference:latest-cu129 docker pull xprobe/xinference:latest-cu129 docker run -d -p 9997:9997 xprobe/xinference:latest-cu129
2. 启动服务
本地单机(开放局域网访问)
bash
xinference-local --host 0.0.0.0 --port 9997 xinference-local --host 0.0.0.0 --port 9997
- 访问 WebUI:http://localhost:9997/ui
3. 加载模型
- WebUI 操作:在 Model Hub 搜索模型 → Launch,自动下载权重。
- CLI 命令:
- bash
xinference launch --model-name qwen2:7b --n-gpu 1 xinference launch --model-name qwen2:7b --n-gpu 1
4. API 调用示例(兼容 OpenAI)
python
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:9997/v1",
api_key="dummy" # 开源版无需密钥
)
resp = client.chat.completions.create(
model="qwen2:7b",
messages=[{"role":"user", "content":"介绍 Xinference"}]
)
print(resp.choices[0].message.content)
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:9997/v1",
api_key="dummy" # 开源版无需密钥
)
resp = client.chat.completions.create(
model="qwen2:7b",
messages=[{"role":"user", "content":"介绍 Xinference"}]
)
print(resp.choices[0].message.content)
六、避坑点(注意事项)
- 硬件门槛
- 7B 模型最低建议 32G 内存。
- 无 GPU 仅 CPU 推理速度极慢。
- Windows 原生支持较差,建议 WSL2 / Linux / macOS M 系列。
- 模型下载慢
- 国内 HuggingFace 源容易超时。
- 建议手动配置 HF 镜像或提前本地缓存权重。
- 资源调度缺陷
- 多模型同时加载显存抢占严重。
- 长文本生成会挤压 Embedding/Rerank 模型资源。
- 建议分机部署轻重模型。
- 分布式运维复杂
- 集群版依赖 DeepEP 通信库,跨机型兼容性差。
- 小规模项目优先选择单机部署。
- 版本依赖冲突
xinference[all]安装易出现 torch/cuda 版本不匹配。- 建议按需安装
[vllm]/[transformers]精简依赖。
- 存储占用巨大
- 模型缓存默认存在用户目录。
- 单 7B 量化模型可达 10GB+,建议通过
XINFERENCE_HOME环境变量自定义存储路径。
- 安全风险
- 开源版无权限隔离,公网暴露 9997 端口存在风险。
- 生产环境必须加反向代理 + 鉴权。
- 多模态生态不完善
- 文生图、视频生成支持模型较少。
- 专业图像生成建议搭配独立 Stable Diffusion 服务。
- 冷启动耗时
- 首次加载大模型预热时间长。
- 生产环境建议常驻模型,避免频繁启停。
- 商业付费渠道
- 国际版订阅仅境外信用卡支付。
- 国内企业需走线下销售签约。
暂无评论