分类导航
发现更多优质 AI 工具
Xinference
Xinference平台使用指南一、平台介绍全称Xorbits Inference定义开源本地/私有化大模型推理服务框架核心优势部署灵活:支持单机或集群均可部署,内置 WebUI。接口统一:对外全兼容 OpenAI 接口,便于迁移。模型统一:统一托管 LLM、多模态、语音、向量、重排模型,替代 Ollama+vLLM 多套工具。数据安全:数据完全本地不出内网,主打企业私有化 AI 底座。二、核心主要功能全品类模型托管 支持 300+ 开源模型(如通义千问、Llama、GLM、Whisper、LLaVA 等),涵盖 LLM、图文多模态、语音 ASR/TTS、Embedding、Rerank 等场景。多推理引擎加速 支持 vLLM、SGLang、llama.cpp、Transformers 等引擎。内置 AWQ、GPTQ、FP8 量化技术,具备分离式 Prefill-Decode 以提升吞吐量。OpenAI 兼容统一 API 提供 /v1/chat/completions、音频、向量等接口。原有 GPT 代码仅需修改 base_url 即可无缝迁移。分布式集群调度 支持多机异构部署(如 GPU、昇腾、M 系列苹果芯片混布),兼容 K8s 并支持弹性扩缩容。配套开发能力 提供 Web 可视化管理、函数调用 Function Calling、基础监控指标。支持 Docker 一键部署,并可无缝对接 LangChain、Dify、FlowUs 等平台。企业级商业特性 具备多租户、权限管控、私有模型仓库、SLA 保障、GDPR/HIPAA 合规认证,以及国产硬件适配。三、适用人群✅ 适合使用个人开发者/学生:适合本地跑开源模型做测试、搭建 RAG 原型。AI 研发/算法团队:作为统一推理底座,用一套 API 管理全部模型。中小企业:适合私有化知识库、客服 AI、离线业务,规避公有 API 成本与数据泄露风险。MLOps 运维:适合搭建本地推理集群,统一调度多 GPU 资源。合规行业(金融/政务):满足数据禁止出内网场景的安全需求。❌ 不适合使用无 GPU/低配设备:无 GPU 或低配轻薄本运行 7B+ 大模型时,速度极差。纯云端需求用户:只想开箱即用云端对话、无本地部署能力的普通用户。超大规模高并发:超大规模公有云高并发商用场景,建议优先选择专业云推理服务。四、免费&付费方案📚 定价官方页面国际站:https://xinference.co/pricing国内中文站:https://xinference.cn/pricing1. 开源免费版(永久免费)授权:MIT 开源,个人/小型商用均可自由部署。功能:单机部署、基础 WebUI、全部推理引擎、OpenAI API、社区文档支持。调用额度:无调用额度限制。限制:无集群支持、无权限管控、无商业售后、不支持国产 NPU 深度适配、无 SLA 保障。2. 企业单机商业版(付费授权)适用:单机生产环境。功能:权限管理、单点登录、国产芯片深度适配、7×12 技术支持、安全审计、私有模型库。限制:不支持多机分布式集群扩展。3. 企业集群商业版(付费授权)适用:大型生产环境、多机集群。功能:全功能 + 多机分布式、弹性伸缩。高可用 Supervisor、K8s Helm、专属技术顾问。SLA 保障、多租户隔离、合规审计。五、快速使用步骤1. 安装(三选一)方式一:pip 完整安装(推荐)bashpip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple 方式二:Docker 部署bashdocker pull xprobe/xinference:latest-cu129 docker run -d -p 9997:9997 xprobe/xinference:latest-cu129 2. 启动服务本地单机(开放局域网访问)bashxinference-local --host 0.0.0.0 --port 9997 访问 WebUI:http://localhost:9997/ui3. 加载模型WebUI 操作:在 Model Hub 搜索模型 → Launch,自动下载权重。CLI 命令:bashxinference launch --model-name qwen2:7b --n-gpu 1 4. API 调用示例(兼容 OpenAI)pythonfrom openai import OpenAI client = OpenAI( base_url="http://127.0.0.1:9997/v1", api_key="dummy" # 开源版无需密钥 ) resp = client.chat.completions.create( model="qwen2:7b", messages=[{"role":"user", "content":"介绍 Xinference"}] ) print(resp.choices[0].message.content) 六、避坑点(注意事项)硬件门槛7B 模型最低建议 32G 内存。无 GPU 仅 CPU 推理速度极慢。Windows 原生支持较差,建议 WSL2 / Linux / macOS M 系列。模型下载慢国内 HuggingFace 源容易超时。建议手动配置 HF 镜像或提前本地缓存权重。资源调度缺陷多模型同时加载显存抢占严重。长文本生成会挤压 Embedding/Rerank 模型资源。建议分机部署轻重模型。分布式运维复杂集群版依赖 DeepEP 通信库,跨机型兼容性差。小规模项目优先选择单机部署。版本依赖冲突xinference[all] 安装易出现 torch/cuda 版本不匹配。建议按需安装 [vllm] / [transformers] 精简依赖。存储占用巨大模型缓存默认存在用户目录。单 7B 量化模型可达 10GB+,建议通过 XINFERENCE_HOME 环境变量自定义存储路径。安全风险开源版无权限隔离,公网暴露 9997 端口存在风险。生产环境必须加反向代理 + 鉴权。多模态生态不完善文生图、视频生成支持模型较少。专业图像生成建议搭配独立 Stable Diffusion 服务。冷启动耗时首次加载大模型预热时间长。生产环境建议常驻模型,避免频繁启停。商业付费渠道国际版订阅仅境外信用卡支付。国内企业需走线下销售签约。
GPUStack
GPUStack使用指南一、平台介绍GPUStack 是一款开源的异构 GPU 集群 + 私有大模型推理管理平台。核心定位:统一纳管 NVIDIA/AMD/Apple Silicon/昇腾/摩尔线程等异构显卡,支持一键部署 LLM/多模态/文生图/语音模型,提供 OpenAI 兼容 API,是本地私有化 AI 推理的理想底座。部署方式:可替代单独部署 vLLM、llama.cpp、SD 服务等,支持 Linux/macOS/Windows(WSL2) 单机及多机集群。基础功能:内置调度、监控、权限管理、负载均衡及故障自愈机制。开源属性:100% 开源免费,支持私有化部署。资源链接:官网:https://gpustack.ai开源仓库:https://github.com/gpustack/gpustack二、主要功能1. 异构算力统一纳管支持多品牌显卡及多服务器合并为单集群。具备自动分配显存/算力能力,支持分布式推理。2. 全品类模型一键部署模型类型:涵盖 LLM/VLM/Embedding/Rerank/文生图/STT/TTS。下载便捷:直连 Hugging Face/ModelScope 自动下载,内置 GGUF/FP16 量化模板。3. 多推理引擎兼容支持 vLLM、llama-box(llama.cpp)、MindIE、SD.cpp 共存与切换。用户可根据需求调节吞吐率或低延迟模式。4. OpenAI 标准 API兼容 Chat Completions、图像生成接口。可无缝对接 Dify、LangChain、Agnes AI 或本地客户端。5. 运维管控能力提供 GPU 实时监控与用量统计。管理 API 密钥、用户权限、Token 限流及请求配额。支持高可用故障转移功能。6. 内置模型市场 Catalog预调好主流开源模型参数,无需手动填写显存或上下文配置,开箱即用。三、适用人群✅ 适合使用个人开发者/AI 爱好者:本地单机显卡跑私有大模型。算法团队:构建私有化 RAG、Agent、本地知识库底座。中小企业:自建离线 AI 服务,有效规避公有 API 数据泄露风险。算力运维人员:管理多服务器异构 GPU 统一集群。国产化需求方:实现昇腾/摩尔线程国产 NPU 的统一调度。❌ 不适合使用纯小白用户:缺乏 Linux 或 Docker 基础,部署有一定门槛。无硬件资源用户:无本地 GPU 或云显卡资源。C 端交互需求者:追求开箱即用的网页对话工具(平台侧重推理底层,无完善的 C 端交互界面)。四、免费 & 付费定价1. 开源核心:永久完全免费适用范围:所有基础集群、模型部署、API、监控功能无限制。限制说明:无节点/显卡数量锁死,本地私有化部署无按量扣费。2. 商业付费:企业增值服务产品形态:官方企业版,针对企业场景提供专属服务。服务包含:专属技术支持、私有化定制。SLA 保障、国产芯片深度适配。企业权限审计、离线交付包。获取方式:定价页面:https://gpustack.ai/pricing模式:按节点/服务器年度订阅,支持上门部署、7×24 工单。定制:需联系销售获取定制报价。3. 特别说明目前无云端 SaaS 版,仅支持本地私有化部署。无网页在线试用平台,必须自备显卡硬件。五、快速使用步骤方式 1:Docker 一键部署(推荐)环境准备:安装 Docker + NVIDIA Container Toolkit 显卡驱动。执行安装:运行官方安装脚本 curl -sfL https://get.gpustack.ai | sh。访问控制台:浏览器访问 http://本机 IP:80,默认账号 admin / 密码 GPUStack@123。构建集群:新建集群,添加本地 Worker 节点(系统自动生成接入命令供其他服务器使用)。部署模型:点击 Deploy Model → 选择 HF/ModelScope → 选量化规格 → 启动。获取 API:复制 API 地址 + 密钥,接入任意 OpenAI 兼容客户端。方式 2:Windows 部署前提条件:必须使用 WSL2 + Docker Engine。注意:不支持原生 Docker Desktop,否则会导致显卡直通异常。驱动要求:主机安装 NVIDIA 驱动,WSL 内部无需安装 CUDA Toolkit。调用 JSON 示例(兼容 OpenAI)接口地址:http://127.0.0.1:80/v1json{ "model": "qwen3-7b-instruct", "messages": [ { "role": "user", "content": "介绍 GPUStack" } ], "temperature": 0.7 } 六、避坑重点显存估算坑 vLLM 默认占用 90% 显存,多模型易冲突。计算公式:模型权重 GB × 1.2 + 2GB。后果:显存不足会持续 Pending 无法启动。国内模型下载慢解决方法:部署前配置 HF 镜像环境变量 HF_ENDPOINT=https://hf-mirror.com。否则:下载超时失败。Windows 原生不兼容严禁:不要直接 Windows 安装。必须:使用 WSL2,Docker Desktop 会导致显卡直通异常。多节点网络坑跨服务器:需开放 80 端口,内部通信端口需放行。防火墙:局域网访问 WSL 需开启 Mirrored 网络模式。密钥安全风险:API Key 仅控制台可见一次,泄露会被滥用占用显卡资源。建议:按团队分配独立 Token 配额。版本升级风险架构:大版本(如 v1→v2)可能涉及架构重构。操作:升级前导出模型配置备份,生产环境不建议自动更新。国产芯片适配建议:昇腾/摩尔线程优先使用对应专用驱动。注意:通用 N 卡引擎在这些芯片上性能下降明显。无在线云端现状:无法网页在线试用,必须自备显卡硬件,无云算力租赁服务。免费无售后开源版:无官方技术支持,报错只能查 GitHub Issues。建议:企业稳定场景建议购买商业服务以获取工单支持。
LM Studio
LM Studio 使用指南一、平台介绍LM Studio(lmstudio.ai)是一款功能强大的本地离线大模型桌面 GUI 工具,全面支持 Windows、macOS 和 Linux 全平台。核心定位:可视化管理 GGUF 开源大模型,替代 Ollama 纯命令行操作。数据隐私:支持全程本地运行,不联网上传数据,拒绝云端计费与 Token 消耗。技术栈:内置兼容 OpenAI/Anthropic 本地 API 服务,支持 RAG 文档问答及远程实例连接(LM Link)。适用场景:隐私优先、离线免费体验、无云端依赖的本地 AI 工作流。二、核心主要功能1. 模型市场一键检索下载:支持 Llama3、Qwen、DeepSeek、Mistral 等主流开源模型。量化格式:专注于 GGUF 量化模型,支持手动导入本地 GGUF 文件。版本选择:提供不同量化版本(如 Q4_K_M),平衡速度与效果。2. 可视化对话图形化窗口:提供直观的用户聊天界面,支持流式输出。参数调节:可调整 Temperature(温度)、上下文长度(Context Window)、GPU 分层卸载(GPU Layers Offload)等推理参数。3. 本地 RAG(检索增强生成)私有文档问答:支持上传 PDF、TXT、Markdown 等格式。本地知识库:构建本地私有文档问答系统,文件数据不出本地。4. 兼容 API 服务本地接口:一键启动 OpenAI 格式本地接口,地址默认为 http://localhost:1234/v1。生态对接:可直接对接任何支持 OpenAI 协议的客户端、脚本或代码库。5. 远程算力连接LM Link:支持局域网或公网连接另一台设备的 LM Studio 算力。资源共享:将远程模型加载到当前会话,共享远端模型资源。6. 命令行工具 (lms)无 GUI 部署:支持无图形界面服务器部署。自动化脚本:支持脚本批量加载模型、自动化推理任务。7. 模型量化工具内置量化:提供模型压缩与量化工具,降低内存与显存占用。三、适用人群✅ 适合用户用户类型核心需求匹配理由隐私需求用户处理合同、源码、涉密文档数据全程本地化,拒绝上传外网AI 新手不想敲命令行图形化界面跑本地大模型,门槛低独立开发者本地调试 AI 应用低成本 API 原型开发,无需云调用学生/爱好者离线免费体验无调用额度限制,资源免费小型技术团队单人私有化 AI 工作台本地部署,灵活控制环境❌ 不适合用户用户类型限制原因低配电脑无 16G 内存/独立显卡(7B 基础模型最低需 10G 内存)大规模集群无原生团队权限管理,不适合企业多人协作云端依赖者不愿占用本地硬盘(模型单文件几 GB~几十 GB)四、免费&付费定价(最新)1. 个人/职场标准版(永久全免费)功能完整:无功能阉割、无模型数量上限、无水印、不限使用时长。商业授权:个人及公司内部商用均可免费使用,无需额外购买授权。功能包含:包含全部 GUI、本地 API、RAG、LM Link、lms 命令行全部功能。2. Enterprise 企业版(付费定制)面向群体:大型企业级需求。核心优势:集中模型管控、SSO 登录、私有模型仓库、管理员权限、专属技术支持。获取方式:无公开定价,需联系官方销售询价。官网定价/企业咨询入口:https://lmstudio.ai/enterprise五、极简使用步骤下载安装:访问官网下载对应系统客户端,启动后切换至简体中文界面。下载模型:在 Model 市场搜索模型,优先选择 Q4_K_M 量化版本(平衡速度/效果)。加载模型:下载完成后点击加载,设置 GPU 卸载层数(有 N 卡/Apple 硅尽量开满)。开始对话:进入 Chat 页面直接对话;如需 API,点击 Developer 标签启动 Local Inference Server。调用 API:接口地址:http://127.0.0.1:1234/v1请求兼容:OpenAI 请求 JSON 格式。API 示例 JSON:json{ "model": "qwen3-7b-q4_k_m", "messages": [ {"role": "user", "content": "写一段本地 API 调用说明"} ], "temperature": 0.7 } 本地 RAG:点击 Chat with Docs,上传本地文件后绑定模型进行问答。六、避坑点📡 下载网络坑问题:国内直连 Hugging Face 模型市场极慢或失败。对策:建议手动去魔搭(ModelScope)或 Hugging Face 下载 GGUF 文件后,使用“导入”功能本地上传。🖥️ 硬件性能坑内存配置:8G 内存仅能跑 3B 极小模型。推荐配置:16G 内存推荐 7B Q4 量化,32G 以上可尝试 14B/34B 模型。显存优化:不开启 GPU 分层卸载,CPU 推理速度极慢且卡顿,务必在界面开启 GPU 层数。📦 模型格式坑格式限制:软件仅支持 GGUF 格式。GPTQ、Safetensors 等格式无法直接加载。解决:如需使用其他格式,需先转换为 GGUF(可使用 llama.cpp 或类似工具转换)。🌐 API 连接坑端口占用:防火墙或代理可能占用 1234 端口。影响:导致本地服务无法访问。解决:关闭占用程序、关闭防火墙或修改 API 端口。💾 磁盘占用坑空间消耗:单 14B 模型即占用 10GB+,多模型极易占满硬盘。维护:建议定期删除不用的模型文件,或使用 LM Link 共享模型而非重复下载。🔒 隐私误区软件安全:软件本身不上传对话记录。版权风险:第三方模型权重需自行核对商用版权,注意模型协议(如非商用协议)。🔗 远程连接坑LM Link 公网:公网连接需手动放行端口,无加密措施易泄露。建议:涉密场景请仅限局域网使用 LM Link。🏢 企业部署限制免费版:无多人权限、无日志审计。合规需求:公司合规场景需购买 Enterprise 版。🔄 更新配置坑版本更新:大版本更新偶尔会重置模型加载配置(如 GPU 层数)。建议:更新前请记录当前的推理参数设置。
vLLM
vLLM使用指南一、平台介绍vLLM 是由伯克利 LMSYS 开源的高性能大模型推理与服务引擎,访问官网 vllm.ai。其核心主打 PagedAttention 分页注意力 技术,大幅降低了 KV 缓存的显存占用。相比原生 Transformers,其吞吐量可提升 10~15 倍。vLLM 主要分为两种形态:开源本地部署版免费开源,无授权费。适用于本地环境、私有云自建推理服务。成本仅为用户自有的 GPU/云服务器硬件开销。vLLM Cloud 托管云服务官方提供的托管 GPU 在线 API。按需付费或订阅模式。核心优势:兼容 OpenAI 标准接口。支持连续批处理(Continuous Batching)。极低显存浪费。适配几乎所有主流开源大模型。二、主要功能超高吞吐推理 基于 PagedAttention 与连续批处理,单 GPU 可承载更多并发对话,显著降低单 Token 成本。支持量化(AWQ/GPTQ/SqueezeLLM)以节省显存。OpenAI 兼容 API 服务 一键启动标准 /v1/chat/completions 接口。现有 OpenAI 代码无需大幅修改即可迁移,且内置 Swagger 调试页面。全模型生态支持 兼容 Llama、Qwen、DeepSeek、Gemma 等主流架构。支持多模态(LLaVA)、MoE 混合专家模型、代码模型以及 LoRA 动态加载。分布式扩容 支持单卡/多卡张量并行,以及 Ray 多机分布式部署。具备自动前缀缓存功能,大幅提升重复上下文的处理速度。多模态原生 原生支持图文 LLaVA、音频输入及百万 Token 级别的长上下文窗口。可观测指标 提供吞吐、延迟、KV 缓存利用率、排队长度等 metrics,支持对接 Prometheus 监控系统。容器化一键部署 官方提供 Docker 镜像,支持 CPU、CUDA、ROCm 及 Apple Silicon 等多种硬件环境。三、适用人群✅ 适合AI 开发者与算法工程师:需要自建私有大模型服务。中小团队/创业公司:日处理千万级 Token,希望降低第三方 API 费用。私有化部署需求:要求数据不出本地或企业内网的企业。开源模型微调与 RAG:作为本地知识库推理底座。多模态与高并发场景:需要低延迟、高并发对话的产品。❌ 不适合资源受限者:无 GPU 资源且无运维能力的纯小白用户。低调用量场景:日调用量低于 10 万 Token,自建 GPU 成本高于商用 API。零代码用户:完全不想运维,只想开箱即用的 C 端用户(需自行开发前端)。四、免费&付费、定价页面地址1. 开源本地版(永久免费)协议:MIT 协议,无授权费。限制:无并发、Token、时长限制,数据完全私有。成本:仅硬件(GPU/云服务器)开销。2. vLLM Cloud 托管云(付费按量/订阅)定价页面:https://vllm.ai/pricing收费模式按量付费(Pay-as-you-go):按输入/输出 Token 计费,单价视模型不同。预留实例订阅:按月包 GPU 算力,适合高并发场景,单价更低。附加收费:跨区流量、超大显存(如 H100)、专属运维 SLA。参考成本(以官网为准)7B 量化模型:约 $0.05~0.12 / 百万 token。70B 大模型:约 $0.3~0.8 / 百万 token。自建建议:日处理千万 Token 以上时,自建 GPU 更划算。五、快速使用教程路线 1:本地开源部署(免费)环境准备需 Python 3.10+ 及 NVIDIA GPU(支持 CUDA)。命令示例:uv pip install vllm启动服务 启动兼容 OpenAI 的服务,监听端口 8000:bashvllm serve Qwen/Qwen2.5-7B-Instruct --host 0.0.0.0 --port 8000 调用示例 使用标准 OpenAI JSON 请求格式:json{ "model": "Qwen/Qwen2.5-7B-Instruct", "messages": [ {"role": "user", "content": "介绍 vLLM"} ], "temperature": 0.7, "stream": true } 访问调试文档地址:http://localhost:8000/docs路线 2:vLLM Cloud 托管云注册账号:前往官网注册并充值。配置控制台:选择模型与 GPU 规格,获取 API Key 与 Base URL。接入调用:在客户端(如 Python SDK)中直接替换 base_url 与 api_key 即可调用,无需管理底层 GPU。六、避坑点(核心干货)显存硬门槛7B 模型 FP16 精度需 ≥24GB 显存。70B 模型建议配备 80GB A100/H100。无量化直接运行容易 OOM,务必开启 AWQ/GPTQ 量化。国内网络两大坑模型下载:HuggingFace 直连超时,建议配置镜像 HF_ENDPOINT=https://hf-mirror.com。Cloud 延迟:vLLM Cloud 为海外节点,直连延迟高,国内业务建议优先采用本地部署。免费开源≠零成本低调用量场景(如日<100 万 Token)下,云 GPU 时租费用可能高于 OpenRouter 等按量 API。日 Token 量建议门槛较高,需计算 ROI。批量并发限流坑默认 max-num-seqs 有限制。超高并发需调大该参数,否则会出现请求排队、首 token 延迟飙升。多卡分布式踩坑多机部署需配置 Ray + NCCL,裸跑易通信报错。单机多卡需添加 --tensor-parallel-size N 参数。KV 缓存内存泄漏超长上下文或频繁唯一 Prompt 可能击穿缓存。建议设置 max-model-len 截断异常输入。Cloud 托管隐性费用预留实例按月付费,闲置仍扣费。超大带宽出网流量可能单独计费,预算需预留。无原生 Web 聊天界面vLLM 仅提供 API 后端。前端、鉴权、会话存储需自行开发,不适合零代码直接给业务使用。商用版权风险Llama 等模型需单独申请 Meta 商用授权。vLLM 仅为推理引擎,不提供模型本身的商用许可。
LocalAI
LocalAI 免费开源本地 AI 推理框架一、平台介绍官网地址:https://localai.io核心仓库:https://github.com/mudler/LocalAI协议说明:开源 MIT 协议,全免费。核心优势:🛡️ 隐私安全:离线本地/私有化运行,所有数据本地处理,绝不上传第三方。🤝 接口兼容:全兼容 OpenAI / Anthropic 接口,直接替换云端 API。🖥️ 硬件支持:支持 CPU / GPU / 分布式集群,适配 NVIDIA/AMD/Intel/Vulkan。⚡ 无限制服务:无厂商用量限速,无 Token 计费,无过期期限。🧩 多模态支持:支持文本、语音、图像、代码等全栈模型推理。二、主要功能1. 文本 LLM 推理兼容模型:Llama3、Qwen、Mistral、RWKV、CodeLlama 等。核心能力:Function Calling(函数调用)流式输出(Streaming)长上下文(Long Context)JSON 结构化返回定位:可直接作为本地 ChatGPT 替代方案。2. 多模态统一 API文生图/图生图:支持 Stable Diffusion 类模型。语音识别:Whisper 语音转文字。语音合成:TTS 语音克隆。图像理解:图像识别 Embedding、重排序 Rerank。3. 配套生态内置LocalAGI:本地智能 Agent 框架。LocalRecall:本地向量知识库,可搭建离线 RAG 检索增强系统。4. 部署与扩展部署方式:Docker 一键启动、二进制包、源码编译、K8s 部署。集群支持:支持单机多模型、P2P 横向扩容。5. Web 管理面板访问入口:http://localhost:8080功能:可视化下载模型、对话调试、参数配置、接口测试。三、适用人群✅ 适合使用开发者:本地调试 AI 应用、私有代码知识库、低成本 API 服务。政企/合规行业:金融、医疗、政务等敏感数据禁止外发云端场景。隐私敏感用户:希望离线使用,拒绝对话数据被厂商采集训练。小团队/工作室:自建内部 AI 工具,节省月度 API 订阅费。运维/私有化工程师:搭建内网离线 AI 服务。❌ 不适合使用纯小白用户:无 Docker、Linux 命令行基础。硬件受限:无闲置硬件(建议 8G 内存起步,大模型需 16G+)。追求极致效果:本地硬件上限低,无法跑顶级超大参数量模型或追求顶级画质。四、免费与付费详情⚠️ 重要区分提示 localai.io 是核心开源框架(完全免费); localai.world 是官方商业咨询/定制工具商店(付费增值服务)。 不需要付费也能完整使用 LocalAI 核心能力。1. 核心框架(100% 免费)开源代码、全部推理 API、Web 面板、多模型支持均无限制。无 Token 计费、无调用额度、无过期期限。仅消耗本机硬件资源,无平台服务费。2. 付费增值服务(非强制,按需选择)定价页面:https://localai.world/shop/定制工具:定制私有化 AI 工具(如法律助手),单品买断($10 ~ €39)。咨询服务:技术咨询服务券(€200)。企业定制:企业私有化定制开发包(数千美元级)。五、快速使用步骤(推荐 Docker)1. 基础 CPU 版启动bashdocker run -p 8080:8080 --name local-ai localai/localai:latest-cpu 2. NVIDIA 显卡加速版启动bashdocker run --gpus all -p 8080:8080 localai/localai:latest-gpu-nvidia-cuda-12 (注:AMD/Intel 显卡需使用对应标签的镜像)3. 持久化存储(防止重启丢失模型)务必挂载本地目录存储模型,否则重启容器后模型会清空:bashdocker run -p 8080:8080 --name local-ai -v ./models:/models localai/localai:latest-gpu 4. 访问与管理浏览器访问管理面板:http://localhost:8080在面板中下载 GGUF 量化模型(推荐)。复制本地 OpenAI 兼容调用地址:http://localhost:8080/v1在任意客户端(如 OpenWebUI、Agnes AI、Python 脚本)填入该地址即可调用。5. 标准请求 JSON 示例json{ "model": "qwen-7b-chat-q4_k_m", "messages": [ { "role": "user", "content": "介绍 LocalAI" } ], "temperature": 0.7, "stream": false } 六、避坑指南1. 模型丢失坑 📉现象:容器删除或重启后,所有模型消失。解决:部署时必加卷挂载参数 -v ./models:/models。2. 硬件性能坑 🖥️现象:CPU 跑 7B 模型卡顿严重、内存溢出。建议:优先使用 Q4_K_M 量化 GGUF 模型;13B 模型建议≥16G 内存,34B≥24G 显存。3. 国内下载失败 📴现象:官方模型源在海外,国内下载慢或中断。解决:手动下载 GGUF 文件放入本地 models 文件夹即可。4. 端口访问与鉴权 🔒外网/局域网:访问需放行 8080 端口。安全性:无鉴权默认开放,生产环境必须配置 API Key 鉴权或防火墙。5. 文档与扩展 🔍现象:高级配置、分布式、RAG 文档不全。解决:遇到问题优先查阅 GitHub Issues 或社区 Wiki。6. 显卡兼容性 🎮现象:AMD/Intel 使用 nvidia 镜像导致无法识别 GPU。解决:根据显卡品牌选择对应标签的 Docker 镜像(WSL 需额外配置)。7. 并发崩溃 OOM 💥现象:多客户端同时调用导致内存爆炸崩溃。解决:设置环境变量限制并发请求数 MAX_ACTIVE_REQUESTS。8. 商用版权 ⚖️注意:框架本身免费开源,但下载的 LLM/图像模型需遵守对应协议。行动:商用前请自行审核模型授权。9. 网络误区 🌐概念:框架本身可离线,但首次下载模型必须联网。场景:模型下载完成后,断网即可全功能运行。10. 付费站点混淆 💸警告:localai.io 是开源官网;localai.world 是付费商城。建议:非企业定制需求,无需付费。
Ollama
Ollama使用全指南一、平台介绍Ollama 是一款开源的本地大模型运行管理器。它支持一键部署 GGUF 量化 LLM,并自动适配 NVIDIA、AMD 及 Mac Metal 等硬件加速。所有推理均在本地离线执行,确保数据不上传至第三方服务器,无云端托管、无在线 SaaS 服务。核心定位:纯本地客户端程序,无在线后台。模型库地址:https://ollama.com/library核心优势:数据隐私安全,完全断网可用,规避 API 费用。二、主要功能极简模型管理支持单行命令进行拉取、运行、删除、导出模型。自动进行 4bit/8bit 量化压缩,显著降低硬件门槛。跨平台全适配完美支持 Windows、macOS、Linux 系统。即使无独立显卡,CPU 亦可运行轻量级模型。OpenAI 兼容 API本地端口默认为 11434。可无缝对接 Dify、AnythingLLM、LangChain 及自定义代码。离线对话支持断网环境下完全离线使用 AI。提供命令行交互式聊天模式。自定义模型封装支持编写 Modelfile。可自定义微调提示词、参数设置及上下文长度。硬件自动调度自动识别显卡显存。支持负载均衡,可限制 CPU/内存占用,防止资源耗尽。批量服务支持后台常驻 ollama serve。允许多个程序并发调用本地模型。三、适用人群✅ 适合场景开发者:构建本地 RAG、Agent、AI 工具原型,规避云端 API 费用与数据泄露风险。办公/学生:本地私密写作、代码生成、知识库构建,敏感文档不传到外网。私有化团队:内网服务器部署,实现企业数据本地闭环。AI 爱好者:低成本测试 Llama3、Qwen、DeepSeek、Mistral 等开源模型。离线场景:网络受限或无网络环境下使用 AI。❌ 不适合场景高并发公网商用服务:并发性能弱于 vLLM 或 TGI,不适合大规模公网 API 接口。无本地电脑用户:仅希望网页在线聊天的用户。文生图/视频需求:Ollama 主打文本大模型,原生多模态支持有限。四、免费&付费、定价页面💰 收费规则(全程 100% 免费无付费套餐)软件本体:开源免费,无订阅、无 Token 计费、无会员、无功能锁。模型资源:全部免费下载,仅消耗本地硬盘与内存资源,无任何线上扣费。商业定位:无官方云服务,因此不存在定价页面。官方说明:Ollama 是本地开源工具,无付费商业套餐,官网无 pricing 页面。🔗 官方关键链接官网主页:https://ollama.com下载页:https://ollama.com/download模型库:https://ollama.com/library官方文档:https://docs.ollama.com五、如何使用(极简步骤)1. 安装软件Windows:官网下载 exe 安装包。macOS:下载 dmg 或执行 brew install ollama。Linux:执行 curl -fsSL https://ollama.com/install.sh | sh。验证安装:终端执行 ollama --version。2. 拉取模型bashollama pull qwen2:7b # 中文 7B 通用 ollama pull llama3:8b # 英文通用 ollama pull codellama:7b # 代码专用 3. 命令行对话bashollama run qwen2:7b # 输入问题,输入 /bye 退出对话 4. 启动 API 服务bashollama serve # API 地址 http://localhost:11434/v1 # 兼容 OpenAI 请求格式 注意:默认仅监听本机访问。5. 常用管理命令bashollama list # 查看本地模型 ollama rm qwen2:7b # 删除模型 ollama ps # 查看运行中模型 6. API 请求 JSON 示例json{ "model": "qwen2:7b", "messages": [ {"role":"user","content":"简要介绍 Ollama"} ], "temperature": 0.7, "stream": false } 六、避坑点国内模型下载极慢模型源在海外,大文件易中断。解决方案:配置终端代理、离线手动导入 GGUF 模型文件。C 盘爆满模型默认存储于 C:\Users\用户名\.ollama\models。解决方案:提前设置环境变量 OLLAMA_MODELS 迁移至其他磁盘。硬件门槛踩坑7B 模型最低建议 8G 内存,13B 建议 16G。无独显 CPU 运行速度极慢,大模型易卡顿死机。局域网/远程无法访问 API默认仅监听 127.0.0.1。解决方案:启动服务前配置环境变量:OLLAMA_HOST=0.0.0.0 ollama serve。无鉴权,公网暴露高危开放 0.0.0.0 后任何人可调用本地模型。解决方案:公网部署必须加 Nginx 密码或 IP 白名单。端口 11434 冲突其他程序占用端口会启动失败。解决方案:可修改 OLLAMA_HOST=127.0.0.1:11435 更换端口。并发能力弱多程序同时调用会排队阻塞,不适合线上高并发业务场景。无原生图形界面纯命令行/API 工具,可视化需搭配 Dify、Open WebUI 等第三方前端。系统资源占满蓝屏Ollama 默认吃满内存。解决方案:通过环境变量限制内存,后台不要同时开大型软件。模型商用权限区分Ollama 本身免费,但部分模型(如 Llama 系列)有商用限制。提示:Qwen、DeepSeek 可免费商用,使用前请核对模型协议。
商汤大装置
SenseCore 商汤大装置使用指南一、平台介绍商汤自研国产化全栈 AI 智算云平台 SenseCore 2.0。作为国内合规 AI 基础设施,平台提供一站式服务,覆盖算力、数据、模型训练/微调/推理、多模态大模型等全链路能力。业务支持:计算机视觉、LLM、多模态业务。部署模式:提供 SaaS 云服务、私有化部署双模式。硬件适配:原生适配国产 GPU,兼容 OpenAI 接口标准。控制台入口:https://console.sensecore.cn二、核心主要功能弹性算力 ECP支持 A100 国产异构 GPU 集群。具备分钟级启停功能,支持超大模型分布式训练,并行加速比达 96%。数据平台 AIDMP功能涵盖数据集版本管理、分支迭代、标注工具及权限隔离。性能优化:1 个数据包=100 万文件。存储服务提供 AFS 全闪存文件存储、AOSS 对象存储。具备多级缓存机制,加速模型读写。ModelStudio 模型开发支持开源/自有模型托管、微调、批量推理及容器化部署。日日新 SenseNova 大模型支持文生对话、多模态、向量库 RAG 及工具调用 API 服务。配套能力包含云监控 CMS、用户权限 IAM、AKSK 密钥管理、AI 沙盒在线调试。三、适用人群✅ 适合使用AI 企业与研发团队:如计算机视觉、自动驾驶、安防、医疗影像等业务团队。大模型研发/微调团队:高校 AI 实验室、大模型微调项目组。政企项目:需要等保合规的国产化 AI 项目、视觉业务。中小企业:从事图像识别、多模态推理 SaaS 服务的初创或小型公司。❌ 不适合使用个人用户:个人轻度玩 AI、无独立企业资质(无免费算力配额)。普通文案用户:仅需简单对话、无需视觉处理或大规模训练的普通用户。海外业务:国内机房架构,境外访问延迟极高,无海外节点支持。四、免费 & 付费定价官方定价文档统一入口:https://www.sensecore.cn/help/docs 算力计费专题页:https://www.sensecore.cn/help/docs/cloud-foundation/ecp 数据平台计费:https://www.sensecore.cn/help/docs/data-service/aidatahub1. 免费政策无永久免费算力:无免费 GPU 训练资源。试用代金券:新用户享有限时试用代金券(官方不定期发放,需企业实名),用于抵扣算力或存储费用。API 调用:个人账号仅开放日日新基础 API 少量测试调用。AI 沙盒:按量计费,无免费额度。算力规格:试用算力规格受限,不可跑大规模训练。2. 付费模式(1)包年包月企业正式版(数据平台 AIDMP)基础服务费:30,000 元/月 或 300,000 元/年。数据包:125 元/月/包(100 万文件)或 1500 元/年/包,数据集不限量。(2)算力/存储按量/资源包GPU 云主机:支持 4 卡/8 卡 A100 包年包月,批量采购单价更低。AI 沙盒按量:vCPU 0.0061 元/核/分钟、内存 0.00154 元/GiB/分钟。存储:TB 级包年包月资源包,分标准/归档存储。(3)日日新大模型 Token 套餐按 Token 预购充值,多模态、向量模型分开计费。企业大客户可议价。3. 支付与资质实名认证:必须企业实名认证方可采购完整算力;个人仅能调用轻量大模型 API。结算方式:支持对公转账、企业月结。五、快速使用步骤注册与实名:官网注册,完成企业实名(营业执照 + 法人核验),获取租户标识。账号管理:登录控制台 console.sensecore.cn,管理员创建子账号、分配权限。获取密钥:右上角头像生成 AKSK 密钥(API 调用、数据读写必备)。分业务流程操作数据:在 AIDMP 创建数据集、上传图像/文本、标注、管理版本分支。训练:在 ECP 选购 GPU 算力,在 ModelStudio 上传模型/开源权重,启动微调任务。推理:在 AMS 创建推理服务,部署模型生成 API 接口。大模型:通过日日新平台调用对话、文生图、向量检索 API。费用管理:在费用中心查看用量、采购资源包、使用代金券抵扣。六、避坑点【资质门槛坑】 个人账号无法购买 GPU 训练算力,仅企业实名开放;无企业资质无法做模型训练业务。【成本预估坑】 分布式训练、海量图像存储费用高,先试用代金券测算用量,不要直接包年。【密钥安全坑】 AKSK 泄露会被消耗资源,禁止前端硬编码、公开代码上传密钥。【数据计费坑】 数据平台按数据包计费,文件超 100 万需额外购买包,不自动扩容,超限无法上传。【网络地域坑】 机房在国内,海外调用 API 延迟极高;无海外节点。【试用时效坑】 代金券有有效期,过期作废;试用算力规格受限,不可跑大规模训练。【权限协作坑】 数据集/算力需单独分配角色,子账号默认无读写权限,批量协作要提前配置用户组。【接口兼容坑】 日日新兼容 OpenAI 格式,但部分 Function Calling 参数存在差异,对接前需查看官方文档。【退款规则坑】 包年包月资源包购买后不支持中途退款,大客户合同需提前协商解约条款。【备份风险】 存储资源到期不续费会锁定数据,需提前导出模型与数据集。
硅基流动
硅基流动(SiliconFlow)指南一、平台介绍硅基流动 是国内领先的国产化开源大模型推理云平台,主要特点包括:自研引擎:搭载 SiliconLLM/OneDiff 加速引擎。接口统一:提供统一 OpenAI 兼容 API,一行代码即可切换模型。一站式托管:支持主流开源 LLM、文生图、多模态模型的托管。灵活算力:提供 Serverless 按量调用、模型微调、专属 GPU 实例及企业私有化部署。访问稳定:国内服务器节点,适配国内开发者及商用开发需求。二、核心功能1. 多模型 API 推理文本类:支持 DeepSeek、Qwen2.5、Llama3、GLM 系列等。视觉类:支持 SDXL、FLUX 等图文/图生图模型。其他能力:代码生成、多模态 OCR 全覆盖。优势:统一兼容 OpenAI 接口,无需修改代码即可切换模型。2. 在线 Playground 体验无需编写代码,直接在网页进行对话。支持生图、调参测试所有模型。3. 模型微调 + 托管支持上传私有数据集微调开源模型。提供一键云端部署推理服务。4. 算力三种模式Serverless 无服务器:按需调用,按量计费。弹性 GPU:应对流量波动,支持自动扩缩容。预留专属 GPU:提供稳定低延迟,适合高并发生产环境。5. 运维管控提供 API 密钥管理。支持用量监控、消费预警。支持 IP 白名单、全链路 HTTPS 加密。6. 配套工具BizyAir ComfyUI 云节点:支持云端本地生图。无需本地显卡:设计师和创作者可直接在云端使用本地模型算力。三、适用人群✅ 适配人群学生/个人开发者:可使用免费 7B 小模型,新用户赠金,适合学习原型开发。独立开发者/小创业团队:低成本接入 DeepSeek 等强推理模型,兼容 OpenAI 接口快速迁移项目。AI 应用厂商:适合搭建 AI 客服、知识库 RAG、内容生成工具。设计师/AI 绘图创作者:支持云端 FLUX/SDXL 批量生图。政企客户:提供私有化部署、等保合规、专属算力服务。❌ 不适合人群纯 C 端对话用户:若无需 API 开发能力,普通对话需求。超大规模训练需求:平台侧重推理,不支持超大规模千亿级自研模型的定制训练。四、免费与付费体系📊 官方定价页面国内中文定价:https://siliconflow.cn/pricing国际英文定价:https://www.siliconflow.com/zh/pricing🎁 免费权益7B 及以下文本模型:永久免费调用,不限额度。新用户赠金:注册即送 14 元体验金(约 2000 万基础 Token),全模型通用。Playground:免费测试,无绑卡门槛。💰 付费模式(按量付费,无月租)文本模型(按百万 Token 计价)轻量开源:0.5 ~ 2 元/百万 Token(INT4 量化版更便宜)。旗舰 DeepSeek-R1/V3:输入低,输出约 16 元/百万 Token(需实名认证 + 最低 50 元充值)。图像生成:512 图约 0.15 元/张,FLUX 高清单价更高。专属 GPU 实例:包月或包时,适合高并发稳定业务。企业定制:支持大额用量阶梯折扣、私有化部署报价。支付渠道:微信、支付宝充值,支持国内本土化支付。五、快速使用步骤1. 注册与认证访问:siliconflow.cn登录:支持手机号、邮箱、GitHub 登录。实名认证:调用收费大模型(如 DeepSeek-R1 等)必须完成实名认证。2. 获取 API Key进入控制台 → API 密钥 → 新建。注意:API Key 仅展示一次,请妥善保存。3. 使用方式方式 1:Playground 在线调试(无需代码,推荐入门)。方式 2:API 调用(兼容 OpenAI SDK)。4. 接口示例基础接口地址:https://api.siliconflow.cn/v1标准请求 JSON:json{ "model": "deepseek-ai/DeepSeek-R1", "messages": [ { "role": "user", "content": "介绍硅基流动平台" } ], "temperature": 0.7 } { "model": "deepseek-ai/DeepSeek-R1", "messages": [ { "role": "user", "content": "介绍硅基流动平台" } ], "temperature": 0.7 } 请求头:textAuthorization: Bearer 你的 API_KEY Authorization: Bearer 你的 API_KEY 5. 进阶操作上传数据集微调模型。购买专属 GPU 实例。六、避坑重点与注意事项⚠️ 1. 免费模型限速风险:7B 免费模型存在 QPS 限制。后果:批量循环调用易触发 429 限流。建议:生产业务必须使用付费大模型或专属实例。🔐 2. 密钥安全风险:前端或公开代码明文存放 API Key。建议:开启 IP 白名单,设置消费预警防止超额扣费。🐌 3. 高峰期延迟风险:Serverless 共享算力在晚高峰存在响应波动。建议:高并发生产场景请选预留 GPU 实例。🔒 4. 实名限制限制:DeepSeek-R1、72B 等高端模型必须实名认证。现状:未实名仅能使用免费小模型。📈 5. Token 双向计费规则:输入 + 输出 Token 均扣费。建议:超长上下文会快速消耗余额,长文本任务需控制 max_tokens。💾 6. 数据留存风险警告:公开 Serverless 环境不适合上传涉密企业数据。建议:涉密场景请选择私有化部署。🧩 7. 接口兼容细节注意:少量小众模型可能不完整支持 Function Calling。建议:选型前先在 Playground 测试功能完整性。⏳ 8. 赠金有效期提醒:新用户 14 元赠金有使用期限。建议:长期闲置会失效,优先用在新项目测试中消耗。
千帆大模型平台
百度千帆大模型平台使用指南一、平台介绍百度智能云一站式国产大模型全生命周期开发/服务平台。核心定位:统一纳管文心 ERNIE 全系 + DeepSeek/通义/GLM 等第三方大模型。服务覆盖:API 调用、微调、数据集、Agent、向量库、托管部署。合规与安全:国内合规、全链路国产化,适配政企、开发者、ToC 产品集成。网络优势:网络直连,无境外访问障碍。官网入口:https://cloud.baidu.com/product/qianfan.html二、核心主要功能模型广场 API 调用主流模型:ERNIE 4.5 / Turbo、Speed / Lite / Tiny(免费轻量模型)、代码模型。多模态能力:文生图、文生视频。工具增强:向量 Embedding、流式输出、Function Calling、联网搜索插件。ModelBuilder 全链路开发数据管理:数据集管理、文本/多模态标注。模型训练:SFT 微调、LoRA 轻量化微调。模型服务:模型托管、批量推理、私有部署。Agent 智能体编排可视化搭建:拖拽式界面构建 AI 智能体。工具集成:绑定搜索、文档解析、工具调用。工作流支持:支持多步骤复杂工作流。向量知识库 RAG内置向量库:文档切片、向量化处理、检索召回。应用场景:快速搭建企业私有知识库问答系统。企业管控能力权限管理:子账号权限、用量配额。监控审计:账单明细、访问日志、IP 白名单。服务保障:SLA 保障、电子发票。在线体验工作台零代码操作:网页直接对话、调参、测试提示词。成果导出:可直接导出对话示例。三、适用人群✅ 适配场景个人/学生开发者:适合 API 测试、本地小工具、毕业设计、低成本原型验证。中小企业:客服机器人、内容生产、内部知识库、轻量化 AI 产品集成。政企单位:合规国产化 AI 系统、政务知识库、行业智能方案建设。AI 服务商:批量微调需求、多模型托管、对外 AI 接口封装服务。❌ 不适配场景纯海外出海无备案业务。追求极致低价且无并发保障场景。完全本地离线推理需求(不支持本地化离线部署)。四、免费&付费方案1. 免费资源永久免费模型:ERNIE-Speed / Lite / Tiny 系列(限制单账号并发,无 Token 上限)。新用户通用免费额度:每款付费旗舰模型(如 ERNIE 4.5 Turbo)赠送 100 万 Token,有效期 3 个月。插件免费调用:百度搜索每日 50 次 免费调用;向量库基础存储免费额度。免费工具:在线体验、基础数据集、简单 Agent 编排。2. 付费模式按量后付费:按输入/输出 Token 计费,先使用后扣费。Token 预付费资源包:月包范围 45~680 元,固定额度,单价更低,支持企业多人共享。增值付费服务:大规模微调算力、批量推理、专属 SLA、私有化部署、高级数据标注。⚠️ 官方定价页面(建议随时查阅最新价格)计费总纲:https://cloud.baidu.com/doc/WENXINWORKSHOP/s/Blfmc9dlf各模型单价明细:https://cloud.baidu.com/doc/WENXINWORKSHOP/s/hlrk4akp7控制台费用管理:https://console.bce.baidu.com/qianfan/chargemanage/list五、快速使用步骤账号准备:注册百度智能云账号,并完成实名认证(个人身份证/企业执照,未实名无法调用 API)。进入控制台:访问千帆控制台地址:https://console.bce.baidu.com/qianfan模型开通:在模型广场选择所需模型,开通对应后付费权限(免费模型无需开通付费)。获取凭证:访问「应用接入-API 密钥」页面,复制 AK(Access Key)/ SK(Secret Key)。调用方式:无代码:体验中心直接对话测试提示词。代码调用:安装千帆 Python SDK,填入 AK/SK 调用 API。进阶开发:数据集上传 → 微调训练 → 发布专属模型 → 接入自有业务系统。极简 API 请求 JSON 示例json{ "model": "ernie-speed-8k", "messages": [ {"role":"user", "content":"介绍千帆平台"} ], "temperature": 0.7, "stream": false } { "model": "ernie-speed-8k", "messages": [ {"role":"user", "content":"介绍千帆平台"} ], "temperature": 0.7, "stream": false } 六、避坑重点实名强制门槛 未实名认证所有 API 直接返回 403 报错;企业用户需对公认证才能使用高并发商用接口。免费模型并发限制 Speed / Lite / Tiny 免费模型单账号并发较低,批量循环调用极易触发限流,商用建议升级付费旗舰模型。免费额度独立分开 各旗舰模型的 100 万 Token 额度互不通用,过期清零不结转,建议优先测试再批量使用。计费易错点 输入 + 输出双向 Token 均计费;长文档检索、多轮对话消耗远超预期,务必在配额管理中监控用量。AK 密钥安全 AK/SK 泄露会被他人消耗额度,禁止写死在前端或公开代码中;控制台支持一键重置密钥。微调算力成本高 全参数微调算力计费昂贵,轻量需求优先选择 LoRA 微调以降低开销。联网搜索单独计费 超出每日 50 次免费搜索后按量扣费,大批量问答场景需严格控制调用频次。国内合规限制 仅支持国内业务,海外用户无法实名认证,不适合境外产品出海。退款规则 预充值余额仅可消费,无无理由退款;资源包到期未用完额度直接作废。第三方模型差异 DeepSeek、GLM 等第三方模型的免费额度不共享文心 ERNIE 福利,价格与限流规则独立计算。
百炼
阿里云百炼 Bailian 平台全指南一、平台介绍阿里云官方一站式大模型开发服务平台(原 Model Studio)。合规底座:国内合规大模型基础设施,数据不出境,适配政企/个人开发者。模型集成:集成通义千问全系、DeepSeek、GLM、Kimi、万相图文视频等主流模型。调用方式:兼容 OpenAI 标准 API,支持纯 API 调用、低代码 AI 应用、知识库 RAG、模型微调/私有化部署。服务优势:服务器位于国内节点,访问稳定、合规可商用。二、核心主要功能1. 模型广场 & API 推理全品类模型:涵盖文本、图像、视频、语音。在线调试:支持一键在线调试模型效果。接口兼容:完全兼容 OpenAI 接口,支持多语言代码调用。2. 低代码 AI 应用搭建可视化 Agent:零代码搭建智能体(Agent)。知识库 RAG:快速构建文档问答系统。工作流编排:支持复杂的对话记忆与工作流编排。场景落地:适合做客服机器人、文档助手等。3. 模型定制能力在线微调:支持模型微调定制。LoRA 训练:支持轻量化训练。私有部署:支持独占实例部署,适配垂直行业私有数据。4. 配套工具生态管理工具:包含文档向量库、Prompt 模板库。监控管控:提供用量监控、调用日志、限流管控、IP 白名单配置。5. 分发渠道多渠道发布:支持一键发布钉钉机器人、网页前端、公众号、API 服务。三、适用人群与限制✅ 适配人群独立开发者/学生:适合原型开发、本地 AI 工具制作、代码生成。中小企业:适合智能客服、内部知识库、内容生产、数据分析。政企单位:满足合规商用大模型需求,数据本地存储,满足等保要求。AI 产品团队:实现多模型统一接入,低成本快速迭代业务。❌ 不适合人群纯聊天小白:仅想聊天者,建议使用更轻量化的网页工具。海外跨境业务:无阿里云账号或涉及跨境业务者(国际节点成本更高)。四、免费与付费方案1. 免费权益开通成本:0 元开通。新人福利:赠送 7000 万 Tokens(单模型 100 万 Token),有效期 90 天(内地节点可用)。其他免费项:在线网页调试无额外费用,知识库基础存储免费。使用限制:存在 RPM 限流,免费额度过期后停止免费调用。2. 付费计费模式按量后付费(默认)按输入/输出 Token、生图张数、训练时长计费。分钟出账、按月结算。资源包/节省计划预充值享受折扣,高用量企业首选,最高可享 5.3 折。Coding Plan 编程订阅Pro 版 200 元/月。每月 9 万次多模型调用额度。注意:每日限量抢购,不支持退款,普通 API 调用不抵扣订阅次数。3. 主流千问模型参考价qwen-turbo:输入 0.0003 元/千Token,输出 0.0006 元/千Token。qwen-plus:输入 0.0008 元/千Token,输出 0.002 元/千Token。qwen-max:输入 0.02 元/千Token,输出 0.06 元/千Token。🔗 官方定价页面(建议实时查询最新价格)主定价页:https://www.aliyun.com/product/bailian/pricing模型详细单价:https://help.aliyun.com/zh/model-studio/model-pricingCoding Plan 订阅页:https://www.aliyun.com/benefit/scene/codingplan五、快速使用步骤账号准备:登录阿里云账号,完成实名认证(必做,否则无法创建密钥)。开通服务:访问 https://bailian.console.aliyun.com,切换**北京(华北2)**地域,开通百炼服务并领取免费 Token。获取密钥:左侧点击「API-Key 管理」创建密钥,务必保存 AccessKey ID/Secret(仅展示一次)。配置模型:模型广场选择模型,复制标准模型 ID。API 基础地址:https://dashscope.aliyuncs.com/compatible-mode/v1开始调用:网页端:在线对话调试、创建 RAG/Agent 应用。代码调用:兼容 OpenAI 格式,填入地址 + 密钥即可调用。监控用量:控制台实时查看 Token 消耗,设置超额预警。六、避坑指南(高频踩坑点)1. 地域限制大坑DeepSeek 等第三方模型仅北京地域可用。密钥与地域绑定,跨地域调用会直接出现 403 鉴权失败。2. 免费额度时效赠送 Token 仅 90 天,过期即清零。余量低于 20% 才会短信提醒,需主动监控用量,防止余额不足影响业务。3. 欠费风险免费额度耗尽自动切换按量计费。未充值会直接欠费,欠费后全部调用关停,导致线上业务中断。建议:开启「额度用尽暂停调用」开关。4. API 密钥安全禁止硬编码密钥、上传至 GitHub 仓库。务必配置 IP 白名单,定期轮换密钥,泄露会导致被盗刷扣费。5. 接口兼容细节请求头必须带 Bearer 前缀。模型 ID 需加 bailian/ 前缀才兼容 OpenAI 工具,少前缀会报 model 不存在。6. RAG 隐性成本知识库检索内容会作为输入 Token计费。超长文档分块后会大幅增加消耗,需精简分段。7. 国内/国际计费隔离内地免费额度、定价与海外节点完全独立。跨境业务无免费额度,单价可能翻倍。8. 报错高频原因401 错误:密钥复制带了空格、漏 Bearer 前缀。429 错误:免费版限流,高并发需升级付费套餐。
TRAE Work
TRAE Work 全指南一、平台介绍字节旗下 全岗位 AI 智能体工作台,由原 SOLO 升级而来。作为国内原生服务,支持网页与桌面双端同步。核心架构与模式双核心模式:涵盖 Work(办公/非开发) 与 Code(代码研发) 两种场景。智能能力:AI 自动拆解复杂任务,具备读写本地/云端文件、自动执行工具链的能力。一站式场景:覆盖文档处理、数据分析、PPT 制作、代码编写、数据可视化等,替代多工具切换。访问地址:https://www.trae.cn/work二、主要功能1. 双模式切换Work 模式:专注于办公与内容创作,支持生成 Word、PPT、Excel,进行数据清洗、报表制作、文案写作、文献综述、批量文件处理及可视化图表生成。Code 模式:专注于研发,支持全栈代码生成、项目调试、Git 操作、仓库分析、自动单元测试及本地工程读写。2. Agent 自主执行用户通过自然语言下发任务。AI 自动拆解步骤,调用内置工具读写文件、运行脚本、导出成品。无需手动分步操作,实现“意图即执行”。3. 多格式文件原生支持支持格式:CSV、JSON、Python、PPTX、Word、Markdown、图片等。操作方式:上传附件即可定向分析或批量修改。4. 多端实时同步网页版:免安装,打开即用。客户端:Windows/macOS 端,支持本地文件深度访问。5. 自定义技能/记忆库支持上传行业文档建立私有知识库。AI 记忆特定需求,减少重复描述。6. 批量并行任务支持多任务同时运行。可实现批量生成报告、批量创建代码文件。三、适用人群✅ 适合使用程序员:独立开发、项目重构、代码调试、脚本自动化。产品/运营:需求文档编写、活动 PPT 制作、数据复盘、竞品分析。数据/分析师:Excel 数据处理、SQL 编写、可视化图表、数据集清洗。学生群体:论文撰写、课程作业、编程实训、汇报材料制作。小团队产研:单人全流程产出,轻量化 AI 办公需求。❌ 不适合使用超大型企业:涉及重度并发、强内网隔离场景(需购买企业版)。低配轻薄本:客户端内存占用相对较高,可能导致卡顿。简单单次对话:若仅需简单聊天或单次问答,普通豆包等轻量工具更合适。四、免费 & 付费1. 个人版(网页/桌面 Work)免费版(永久可用,无 Token 买断限制)全功能开放:Work + Code 双模式均可用。并发限制:云端限制 2 个任务并发上限。排队机制:高峰期任务排队,无优先通道。模型使用:基础模型不限量使用,无强制额度耗尽。个人付费会员(免排队 + 提并发)付费权益:免排队速通、提升云端并发、优先调用高阶模型、更大上下文窗口。查看定价:https://www.trae.cn/pricing2. 企业版(火山引擎售卖,多人团队)定价文档:https://www.volcengine.com/docs/86677/2387319套餐档位:团队版:149 元/席/月。单席位起购,最大并发 10 任务,2G 企业知识库。旗舰版:259 元/席/月。3 席起购,共享额度池、CLI、IP 白名单、4G 知识库。计费方式:席位包月预付费 + 超额 Token 按量扣费,支持加量包充值。五、快速使用步骤注册登录:打开 https://work.trae.cn,使用字节账号一键登录;或直接下载桌面客户端。模式选择:在左上角切换,文职选 Work,写代码选 Code。绑定工作空间(关键):网页版:自动创建云端项目,直接上传文件对话。客户端:新建或选择本地文件夹作为 Workspace,AI 可读写该文件夹内全部文件。下发任务:输入自然语言指令,支持上传 Excel/PPT/代码包附件;使用斜杠 / 唤起快捷技能。验收迭代:AI 自动生成文件展示在面板,直接批注修改、二次下发优化指令。导出成果:一键下载 PPT、Excel、代码包、PDF 至本地。六、避坑重点客户端硬件坑:桌面端高占用 CPU/内存,8G 及以下轻薄本极易卡顿、闪退。不用时完全退出进程,定期清理缓存目录。免费版排队痛点:晚间高峰期队列长,大批量任务建议开会员速通,或拆分小任务错峰执行。本地文件安全:客户端授权文件夹后 AI 可读全部文件,涉密项目请单独新建隔离文件夹,不要绑定工作电脑全盘。文件编码乱码:生成 CSV/代码时常出现中文乱码,Prompt 强制加一句:“输出文件统一 UTF-8 编码”。任务并发限制:免费版本仅 2 个云端任务并行,多批量任务会排队等待,不要一次性提交 10+ 个长耗时任务。企业与个人账号不互通:个人会员权益无法在企业席位复用,企业需单独采购火山引擎席位。缓存占用 C 盘:客户端缓存默认存在 C 盘,长期使用可能占用数十 G;建议修改文档修改存储目录路径,避免磁盘爆满。代码项目扫描慢:大型代码仓库建议提前写 .traeignore 排除 node_modules、缓存文件夹,大幅提速。网页版无法访问本地文件:仅客户端支持读写本地工程;纯本地开发必须下载桌面端。任务丢失风险:复杂长任务完成后立刻导出本地,云端项目长期闲置存在缓存清理丢失可能。通用高效任务 Prompt 模板为了配合您的使用,以下整理了三类场景的通用 Prompt 模板,可直接复制微调使用:🟢场景一:数据分析类markdown# Role: 数据分析师 # Task: 基于上传的 Excel/CSV 文件进行清洗与分析 # 步骤: 1. 自动读取上传的文件(支持 CSV/Excel/JSON)。 2. 检查数据完整性,修复缺失值与异常值。 3. 计算核心指标(平均值、增长率、同比等)。 4. 生成数据可视化图表建议。 5. 输出分析结论与建议。 # 要求: - 输出文件统一 UTF-8 编码。 - 表格列名保持原样,不做修改。 - 最终结果请以 Markdown 表格形式展示关键数据。 - 分析语言简洁专业,适合汇报。 # Role: 数据分析师 # Task: 基于上传的 Excel/CSV 文件进行清洗与分析 # 步骤: 1. 自动读取上传的文件(支持 CSV/Excel/JSON)。 2. 检查数据完整性,修复缺失值与异常值。 3. 计算核心指标(平均值、增长率、同比等)。 4. 生成数据可视化图表建议。 5. 输出分析结论与建议。 # 要求: - 输出文件统一 UTF-8 编码。 - 表格列名保持原样,不做修改。 - 最终结果请以 Markdown 表格形式展示关键数据。 - 分析语言简洁专业,适合汇报。 🟠场景二:PPT 生成类markdown# Role: 内容设计师 # Task: 生成结构清晰、内容丰富的 PPT 大纲 # 输入信息: 主题:[在此输入主题] 受众:[在此输入受众] 核心目标:[在此输入目标] # 步骤: 1. 规划 PPT 页数与结构(封面、目录、正文、总结)。 2. 每页生成标题与核心要点(Bullet Points)。 3. 建议配图风格与排版方式。 4. 输出可复制到 PPT 的文本内容。 # 要求: - 内容逻辑严密,避免冗余。 - 语言风格需符合 [商务/演讲/教学] 调性。 - 请列出每一页需要使用的关键数据或图片。 # Role: 内容设计师 # Task: 生成结构清晰、内容丰富的 PPT 大纲 # 输入信息: 主题:[在此输入主题] 受众:[在此输入受众] 核心目标:[在此输入目标] # 步骤: 1. 规划 PPT 页数与结构(封面、目录、正文、总结)。 2. 每页生成标题与核心要点(Bullet Points)。 3. 建议配图风格与排版方式。 4. 输出可复制到 PPT 的文本内容。 # 要求: - 内容逻辑严密,避免冗余。 - 语言风格需符合 [商务/演讲/教学] 调性。 - 请列出每一页需要使用的关键数据或图片。 🔵场景三:代码研发类markdown# Role: 全栈工程师 # Task: 项目重构与代码生成 # 上下文: 项目技术栈:[Node.js/Python/etc] 当前需求:[描述具体功能或修复 Bug] # 步骤: 1. 分析当前代码结构,识别冗余模块。 2. 提供优化后的代码片段或完整文件。 3. 编写单元测试用例(自动单元测试)。 4. 处理潜在的安全漏洞或性能瓶颈。 # 要求: - 保持现有代码风格与规范。 - 对修改部分添加详细注释。 - 输出文件统一 UTF-8 编码,避免中文乱码。 - 不要引入未声明的第三方库,除非必要。 # Role: 全栈工程师 # Task: 项目重构与代码生成 # 上下文: 项目技术栈:[Node.js/Python/etc] 当前需求:[描述具体功能或修复 Bug] # 步骤: 1. 分析当前代码结构,识别冗余模块。 2. 提供优化后的代码片段或完整文件。 3. 编写单元测试用例(自动单元测试)。 4. 处理潜在的安全漏洞或性能瓶颈。 # 要求: - 保持现有代码风格与规范。 - 对修改部分添加详细注释。 - 输出文件统一 UTF-8 编码,避免中文乱码。 - 不要引入未声明的第三方库,除非必要。
Dokobot
Dokobot 完整使用攻略一、平台介绍Dokobot 是面向AI Agent的浏览器视觉读取工具,中文官网 dokobot.ai/zh-CN,核心定位:给大模型/智能代理装上“真实浏览器眼睛”。 传统AI联网抓取只读取网页源码DOM,无法处理JS动态渲染、登录权限、反爬网站;Dokobot直接调用本地Chrome/Edge真实浏览器,读取渲染完成后的页面像素视图,复用你浏览器已登录账号、Cookie,像真人一样浏览网页。 二、主要功能1. 本地网页读取(核心免费能力)dokobot read [URL]:全自动加载页面、执行JS、滚动加载全部内容,自动截图、提取图文、表格、链接自动绕过登录墙、动态加载页面、电商/社交平台反爬校验,复用浏览器登录态,无需额外账号密码像素级页面解析,输出干净Markdown,剔除冗余代码,大幅减少LLM Token消耗支持多页滚动、分页读取、页面截图返回、多语言内容提取(14+语种)2. 浏览器插件独立功能(普通用户免代码使用)网页内右键唤起工具,无需Agent即可直接操作:页面全文总结、选中内容翻译、局部问答解读一键导出页面结构化笔记、摘要、素材清单网页长文精简、重点信息提取、竞品页面对比分析3. Agent远程对接(MCP/Skill兼容)开放MCP标准协议,一键接入本地AI代理、代码编辑器Agent提供标准化Skill技能库,支持Agent自动批量网页调研、价格监控、资讯搜集远程模式:云端API远程操控多台设备浏览器,跨机器统一调度任务4. CLI命令行批量自动化终端批量执行网页采集、定时页面巡检、竞品数据定时抓取;支持脚本循环、批量URL批量读取、结果本地导出Markdown/JSON文件5. 多浏览器兼容支持Chrome、Edge、Brave Chromium内核浏览器,Windows/macOS/Linux全平台客户端CLI三、适用人群1. 优先适配人群AI Agent开发者/本地大模型玩家 搭建OpenClaw、Hermes、Cursor、Claude Code本地代理,解决联网读取网页卡顿、反爬、动态页面失效问题。行业情报/内容运营 竞品网页调研、电商价格监控、行业资讯批量抓取、论文/行业文档网页批量整理。程序员/代码工作者 自动读取官方文档、在线API手册、论坛技术帖,让AI自动查阅网页资料写代码。学生、研究员、自媒体 长网页文献总结、多网页信息整合、海外资料翻译梳理,免复制粘贴整理素材。企业内部办公人员 读取公司内网、登录后台数据,传统爬虫无权限访问的私有页面。2. 不适合人群纯小白、不会安装浏览器扩展/终端命令行的无代码用户(上手有技术门槛);大规模商用爬虫、高并发云端7×24小时采集(本地模式单设备限速,高并发必须付费云端);需要独立网页生成、AI绘画、通用对话的普通C端用户(Dokobot只做网页读取,无大模型对话能力)。四、免费&付费情况1. 本地模式【永久免费,无任何限制】无需注册账号、无需API密钥、不绑定信用卡不限读取页面数量、不限每日访问次数、无Token扣费仅使用本机浏览器资源,数据全程本地处理,不上传页面内容至云端限制:仅本机设备可用,无法远程跨机器调用、无云端任务队列、批量任务速度受本机浏览器性能约束2. 远程云端API付费套餐(按需订阅)面向多设备、高并发、自动化团队,开通远程控制、云端任务调度:Starter轻量版 适合个人重度用户,按月计费;解锁远程单设备、任务排队、基础API调用额度Team团队版 多设备同时连接、批量定时任务、API高并发、专属客服、完整MCP远程权限Enterprise企业定制 私有化部署、私有云端节点、团队权限隔离、SLA稳定保障、定制采集脚本支付:境外信用卡支付,无微信/支付宝国内通道计费逻辑:云端API按调用频次/并发量计费;本地模式完全不产生任何费用五、分步使用教程方式1:普通用户(仅浏览器插件,零代码)打开官网 https://dokobot.ai/zh-CN ,点击「添加至Chrome」安装扩展打开任意网页,点击右上角Dokobot图标,选中文字即可:总结/翻译/提取信息读取完整页面:点击「读取整页」,自动生成结构化摘要笔记方式2:开发者对接AI Agent(CLI完整流程)安装Chrome扩展,开启插件本地服务终端全局安装CLI工具:npm i -g @dokobot/cli@latest 基础读取命令示例# 读取单网页 dokobot read https://example.com 读取并输出JSON结构化结果 dokobot read https://example.com --format json Agent接入配置:在Cursor/OpenClaw MCP配置文件填入Dokobot本地服务地址,重启Agent即可自动调用浏览器读取网页方式3:远程云端模式(付费后)官网注册账号,购买对应套餐,获取远程API KeyCLI增加远程参数,跨电脑调用浏览器实例Agent配置远程MCP地址,实现多设备统一网页采集六、避坑重点(高频踩坑)1. 网络访问问题(国内最大痛点)官网、插件商店、远程云端服务器均在海外,国内直连会出现:插件加载失败、CLI连接超时、远程API调用无响应;本地插件基础功能勉强可用,远程付费模式国内访问稳定性差。2. 技术门槛坑纯图形化操作功能有限,批量自动化、Agent联动必须掌握终端npm命令、MCP配置;无编程基础用户只能简单用网页总结功能,无法发挥核心价值。3. 本地免费模式性能限制依赖本机Chrome,浏览器开太多页面会造成读取卡顿、页面加载超时;批量循环采集时,无云端任务队列,一次性读取几十页容易触发浏览器内存溢出崩溃;单设备并发有限,不适合7×24小时不间断监控。4. 隐私区分坑本地模式:页面数据全部在本机处理,不上传云端,隐私安全;付费远程模式:网页内容会上传官方云端处理,涉密企业内网页面禁止开启远程API。5. 浏览器兼容坑仅支持Chromium内核(Chrome/Edge/Brave),不支持Firefox、Safari;使用其他浏览器无法安装扩展、CLI读取失效。6. 付费订阅坑仅支持境外信用卡,国内用户充值、退订流程繁琐;无按月试用,企业版价格偏高,个人轻度使用完全没必要付费。7. Agent联动配置坑MCP配置参数错误会导致Agent无法调用Dokobot;升级CLI/浏览器扩展后,本地服务端口会变更,需要重新重启插件才能恢复连接。8. 反爬边界风险复用个人浏览器Cookie访问电商、社交平台批量采集,频繁大量读取仍会触发平台风控,导致账号限流;建议控制采集间隔,不要高频循环抓取。9. Token误区仅能减少网页读取产生的Token,不包含大模型调用额度,搭配Agnes、OpenAI等API仍需单独付费大模型Token。附:dokobot read 标准输出JSON示例{ "url": "https://dokobot.ai/zh-CN", "title": "DOKOBOT - 给你的AI AGENT一双真正的眼睛", "language": "zh-CN", "clean_markdown": "# DOKOBOT\n给你的AI AGENT一双真正的眼睛...", "links": [ {"text": "安装教程", "href": "https://dokobot.ai/zh-CN/install"}, {"text": "定价", "href": "https://dokobot.ai/zh-CN/pricing"} ], "images": [ "https://dokobot.ai/static/banner.png" ], "page_screenshot": "base64编码截图字符串", "read_cost_tokens": 620 }