首页 / 详情
Site icon

Xinference

基本信息

Xinference 网站截图预览

工具详情

Xinference平台使用指南

一、平台介绍

全称

Xorbits Inference

定义

开源本地/私有化大模型推理服务框架

核心优势

  • 部署灵活:支持单机或集群均可部署,内置 WebUI。
  • 接口统一:对外全兼容 OpenAI 接口,便于迁移。
  • 模型统一:统一托管 LLM、多模态、语音、向量、重排模型,替代 Ollama+vLLM 多套工具。
  • 数据安全:数据完全本地不出内网,主打企业私有化 AI 底座。

二、核心主要功能

  1. 全品类模型托管 支持 300+ 开源模型(如通义千问、Llama、GLM、Whisper、LLaVA 等),涵盖 LLM、图文多模态、语音 ASR/TTS、Embedding、Rerank 等场景。
  2. 多推理引擎加速 支持 vLLM、SGLang、llama.cpp、Transformers 等引擎。内置 AWQ、GPTQ、FP8 量化技术,具备分离式 Prefill-Decode 以提升吞吐量。
  3. OpenAI 兼容统一 API 提供 /v1/chat/completions、音频、向量等接口。原有 GPT 代码仅需修改 base_url 即可无缝迁移。
  4. 分布式集群调度 支持多机异构部署(如 GPU、昇腾、M 系列苹果芯片混布),兼容 K8s 并支持弹性扩缩容。
  5. 配套开发能力 提供 Web 可视化管理、函数调用 Function Calling、基础监控指标。支持 Docker 一键部署,并可无缝对接 LangChain、Dify、FlowUs 等平台。
  6. 企业级商业特性 具备多租户、权限管控、私有模型仓库、SLA 保障、GDPR/HIPAA 合规认证,以及国产硬件适配。

三、适用人群

✅ 适合使用

  • 个人开发者/学生:适合本地跑开源模型做测试、搭建 RAG 原型。
  • AI 研发/算法团队:作为统一推理底座,用一套 API 管理全部模型。
  • 中小企业:适合私有化知识库、客服 AI、离线业务,规避公有 API 成本与数据泄露风险。
  • MLOps 运维:适合搭建本地推理集群,统一调度多 GPU 资源。
  • 合规行业(金融/政务):满足数据禁止出内网场景的安全需求。

❌ 不适合使用

  • 无 GPU/低配设备:无 GPU 或低配轻薄本运行 7B+ 大模型时,速度极差。
  • 纯云端需求用户:只想开箱即用云端对话、无本地部署能力的普通用户。
  • 超大规模高并发:超大规模公有云高并发商用场景,建议优先选择专业云推理服务。

四、免费&付费方案

📚 定价官方页面

  • 国际站:https://xinference.co/pricing
  • 国内中文站:https://xinference.cn/pricing

1. 开源免费版(永久免费)

  • 授权:MIT 开源,个人/小型商用均可自由部署。
  • 功能:单机部署、基础 WebUI、全部推理引擎、OpenAI API、社区文档支持。
  • 调用额度:无调用额度限制。
  • 限制:无集群支持、无权限管控、无商业售后、不支持国产 NPU 深度适配、无 SLA 保障。

2. 企业单机商业版(付费授权)

  • 适用:单机生产环境。
  • 功能:权限管理、单点登录、国产芯片深度适配、7×12 技术支持、安全审计、私有模型库。
  • 限制:不支持多机分布式集群扩展。

3. 企业集群商业版(付费授权)

  • 适用:大型生产环境、多机集群。
  • 功能:
  • 全功能 + 多机分布式、弹性伸缩。
  • 高可用 Supervisor、K8s Helm、专属技术顾问。
  • SLA 保障、多租户隔离、合规审计。

五、快速使用步骤

1. 安装(三选一)

方式一:pip 完整安装(推荐)

bash

pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple
pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple

方式二:Docker 部署

bash

docker pull xprobe/xinference:latest-cu129
docker run -d -p 9997:9997 xprobe/xinference:latest-cu129
docker pull xprobe/xinference:latest-cu129
docker run -d -p 9997:9997 xprobe/xinference:latest-cu129

2. 启动服务

本地单机(开放局域网访问)

bash

xinference-local --host 0.0.0.0 --port 9997
xinference-local --host 0.0.0.0 --port 9997
  • 访问 WebUI:http://localhost:9997/ui

3. 加载模型

  • WebUI 操作:在 Model Hub 搜索模型 → Launch,自动下载权重。
  • CLI 命令:
  • bash
xinference launch --model-name qwen2:7b --n-gpu 1
xinference launch --model-name qwen2:7b --n-gpu 1

4. API 调用示例(兼容 OpenAI)

python

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:9997/v1",
    api_key="dummy" # 开源版无需密钥
)

resp = client.chat.completions.create(
    model="qwen2:7b",
    messages=[{"role":"user", "content":"介绍 Xinference"}]
)

print(resp.choices[0].message.content)
from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:9997/v1",
    api_key="dummy" # 开源版无需密钥
)

resp = client.chat.completions.create(
    model="qwen2:7b",
    messages=[{"role":"user", "content":"介绍 Xinference"}]
)

print(resp.choices[0].message.content)

六、避坑点(注意事项)

  1. 硬件门槛
  • 7B 模型最低建议 32G 内存。
  • 无 GPU 仅 CPU 推理速度极慢。
  • Windows 原生支持较差,建议 WSL2 / Linux / macOS M 系列。
  1. 模型下载慢
  • 国内 HuggingFace 源容易超时。
  • 建议手动配置 HF 镜像或提前本地缓存权重。
  1. 资源调度缺陷
  • 多模型同时加载显存抢占严重。
  • 长文本生成会挤压 Embedding/Rerank 模型资源。
  • 建议分机部署轻重模型。
  1. 分布式运维复杂
  • 集群版依赖 DeepEP 通信库,跨机型兼容性差。
  • 小规模项目优先选择单机部署。
  1. 版本依赖冲突
  • xinference[all] 安装易出现 torch/cuda 版本不匹配。
  • 建议按需安装 [vllm] / [transformers] 精简依赖。
  1. 存储占用巨大
  • 模型缓存默认存在用户目录。
  • 单 7B 量化模型可达 10GB+,建议通过 XINFERENCE_HOME 环境变量自定义存储路径。
  1. 安全风险
  • 开源版无权限隔离,公网暴露 9997 端口存在风险。
  • 生产环境必须加反向代理 + 鉴权。
  1. 多模态生态不完善
  • 文生图、视频生成支持模型较少。
  • 专业图像生成建议搭配独立 Stable Diffusion 服务。
  1. 冷启动耗时
  • 首次加载大模型预热时间长。
  • 生产环境建议常驻模型,避免频繁启停。
  1. 商业付费渠道
  • 国际版订阅仅境外信用卡支付。
  • 国内企业需走线下销售签约。


评论

暂无评论