分类导航

发现更多优质 AI 工具

全部 编程代码 创作写作 视频音频 图像视觉 学习辅导 办公效率 设计创意 大模型 提示词 Skills 自动化 知识库 开源 副业
Umi-OCR图标

Umi-OCR

Umi-OCR 使用指南一、平台介绍Umi-OCR 是一款国产离线开源 OCR 工具,基于 PaddleOCR 引擎开发,采用 MIT 开源协议。安全隐私:全程本地运算,不上传图片,彻底杜绝云端隐私泄露风险。网络要求:断网可用,完全离线运行。系统支持:兼容 Windows/Linux x64 架构。安装方式:解压即用,无需安装,无驱动依赖。二、核心主要功能1. 截图识别自定义快捷键:支持设置全局热键,快速框选屏幕区域。多源识别:支持点击屏幕截图识别,也支持复制图片后粘贴识别。智能排版:识别后自动合并自然段,优化文本格式。2. 批量图片 OCR无限数量:拖入图片或文件夹即可处理,无数量上限。区域屏蔽:支持设置忽略区域,自动跳过水印、页眉、页脚。多格式导出:支持导出为 TXT、MD、CSV、JSONL 等多种格式。3. 批量 PDF 文档扫描件处理:针对扫描版 PDF 提取文字。PDF 优化:生成的 PDF 为双层可检索格式,方便后期编辑与搜索。4. 附加识别能力多模态解析:支持二维码解析与生成。特殊文本:内置数学公式识别、竖排文本适配功能。多语言支持:内置简繁中、英、日、韩、俄、德、法等语言模型,支持手动扩充。5. 外部集成与后处理接口调用:提供 HTTP 接口与命令行支持,可对接自动化脚本或第三方软件。文本清洗:自动合并自然段,去除多余换行,过滤干扰文字。三、适用人群✅ 推荐适用人群学生群体:课件截图、黑板照片、论文文献、公式提取。职场办公:合同/发票扫描件、截图文案、批量资料数字化。隐私敏感用户:财务单据、身份证、内部机密(需本地处理,不上传云端)。自媒体创作者:网页截图、视频字幕提取。开发者:本地 OCR 接口二次开发、自动化工具集成。❌ 不适合使用场景MacOS 用户:无官方原生客户端,需依赖虚拟机或 WSL,体验不佳。老旧硬件:无 AVX 指令集的老旧 CPU 无法启动 Paddle 引擎。移动端用户:不支持手机或平板直接运行。32 位系统:仅支持 x64 架构操作系统。四、免费/付费情况完全免费:100% 永久免费,无付费版本、无会员、无次数限制、无软件水印。开源协议:源码完全开源,个人及商用均可自由使用、二次修改及分发。无隐形消费:无定价页面,不存在付费套餐或充值渠道。模型扩展:仅可选额外下载多语言模型包,所有扩展资源均免费。五、快速使用步骤软件安装下载 Release 版本压缩包,解压至任意文件夹。直接运行 Umi-OCR.exe 即可启动。截图识别进入 设置 -> 快捷键,绑定截图热键(默认为 Win + Alt + C)。按下快捷键框选区域,软件自动输出文本,支持一键复制。批量识别切换至「批量 OCR」模式。拖入图片文件,设置「忽略区域」框选水印等干扰内容。点击开始任务,处理完成后批量导出文件。PDF 识别切换至「批量文档」模式。导入 PDF 文件,批量提取文字内容。剪贴板快捷识别从网页或微信复制图片后,软件点击「粘贴图片识别」即可完成。进阶开发开启 HTTP 接口功能。通过代码调用本地 OCR 服务,实现程序化调用。六、避坑点(高频问题与解决方案)1. 硬件兼容坑问题:老 CPU 无 AVX 指令集无法启动 Paddle 引擎;32 位系统无法运行。解决:需切换 RapidOCR 引擎;确认系统为 x64 架构。2. 多屏缩放异常问题:多显示器 Windows 缩放比例不一致,导致截图画面错位、识别失败。解决:统一所有显示器缩放比例,或使用系统自带截图工具截取后导入。3. 大图识别模糊问题:超长截图或超大图片出现识别残缺、漏字。解决:在 设置 中调高「限制图像边长」数值,或分块识别。4. 硬盘占用大问题:完整多语言模型包体积超 1GB。解决:若仅用中文,可在模型目录删除多余的语言模型包以节省空间。5. 忽略区域逻辑误区问题:忽略框仅能屏蔽固定水印,动态不规则水印无法彻底清除。解决:复杂图片建议单张手动剔除干扰区域,或使用图像预处理工具先修复。6. Mac 用户限制问题:无官方 Mac 客户端。解决:只能通过虚拟机或 WSL 运行,体验不如本地客户端。7. 杀毒误报问题:解压包易被 Windows Defender 拦截。解决:添加解压目录至杀毒软件白名单;软件无病毒,开源源码可自查。8. 离线模型更新问题:新增语种无在线自动下载功能。解决:需手动下载模型文件,并按指定路径放入目录。9. 接口安全风险问题:HTTP 接口默认本地开放。解决:切勿暴露公网 IP,避免他人调用占用本地算力;内部使用建议设置密码或限流。10. 批量任务卡顿问题:一次性导入上千张图会导致内存飙升,处理变慢。解决:建议分批次处理,避免单次内存溢出。

PaddleOCR图标

PaddleOCR

AI Studio PaddleOCR 使用指南📚 简介:本文档旨在帮助用户全面了解百度 AI Studio 平台上的 PaddleOCR 工具,涵盖平台定位、核心功能、适用场景、费用说明、使用步骤及避坑指南,助您快速上手云端 OCR 训练与识别。一、平台介绍1. 核心构成PaddleOCR:百度飞桨开源 OCR 算法套件,遵循 Apache2.0 协议,完全开源且免费。AI Studio:百度云端在线算力与代码运行平台。环境优势:内置 PaddleOCR 全套环境,无需本地配置。运行模式:支持在线推理、模型微调、API 调用、可视化图片上传识别。2. 平台定位首选方案:国内免费中文 OCR 首选的云端实训平台。一站式服务:提供从图片/PDF 文字识别、定制模型训练到线上接口调用的完整流程。网络优势:国内网络访问无障碍,延迟低,速度快。3. 生态配套在线识别页:提供前端无代码识别体验。Notebook 环境:支持代码开发与模型训练。API 服务:开放接口供程序调用。案例库:提供行业微调案例库及完整教程。二、主要功能1. 网页端零代码识别操作方式:直接拖拽上传 JPG/PNG/PDF/TIFF 文件。核心能力:自动版面分析、文字提取、表格还原。后期处理:支持在线校对,并支持导出为 TXT / Markdown / JSON 格式。2. Notebook 代码全流程能力基础推理:涵盖通用中英文、手写体、票据、表格等多种场景。模型微调:支持上传自定义数据集,训练专属模型(如车牌、证件、小票、古籍等)。数据工具:内置文字合成工具、标注工具及数据集预处理功能。模型导出:支持导出 Paddle 推理模型及 ONNX 格式,适配本地或移动端部署。3. 开放 API/MCP 远程调用获取 Token:复制个人 Access Token 即可使用。批量服务:服务端支持批量识别 PDF/图片,适合程序自动化处理。返回结构:提供包含文字、坐标、置信度的结构化 JSON 数据。4. 配套资源库预训练模型:预置 PP-OCRv4、PaddleOCR-VL 多模态文档解析模型。学习资源:提供免费数据集、完整教程及可直接 Fork 运行的案例项目。三、适用人群与场景✅ 适合人群学生与算法新手:零成本学习 OCR 技术、深度学习模型训练。个人办公用户:日常扫描 PDF、证件、票据的文字提取需求。中小开发者:快速验证 OCR 需求、实现批量识别、进行私有化模型训练。中小企业:内部文档数字化、票据识别场景,低成本验证业务方案。❌ 不适合场景高并发商用生产:免费 API 每日额度有限,高流量业务需切换至百度智能云付费 OCR。离线无网环境:AI Studio 依赖云端算力,若需离线使用,必须本地部署 PaddleOCR。四、免费 & 付费详情1. AI Studio 云端算力(Notebook 运行)免费规则:每日发放 8 点 GPU 算力(对应 V100 16G),1 算力=1 小时。有效期:24 小时。CPU 环境:永久不限时。额外获取:签到、做任务、参赛可兑换额外算力卡。存储空间:固定 100G 免费。付费扩容:算力不足时可购买付费算力卡。定价页:https://aistudio.baidu.com/aistudio/pay2. PaddleOCR 网页在线识别(前端体验页)识别次数:登录账号后 无限次 免费识别。未登录状态:每日提供 3 次 试用,无收费项目。网址:https://aistudio.baidu.com/paddleocr3. AI Studio 开放 API 调用免费额度:单模型每日 3000 页 PDF/图片识别。单次限制:单次最多处理 100 页。超量处理:超出额度将返回 429 限流错误。商用扩容:需跳转 百度智能云文字识别 按量计费。4. 开源代码包(本地 pip 安装)费用:永久完全免费。限制:无任何调用额度、商用限制。五、快速使用步骤方式 1:零代码网页识别(最快上手)打开网址:https://aistudio.baidu.com/paddleocr。使用百度账号登录。上传图片或 PDF 文件,系统自动执行版面解析与文字识别。在线修改识别错误后,导出为 JSON/TXT/Markdown 格式。方式 2:Notebook 代码训练/推理(开发模式)进入 AI Studio 首页,创建新项目,选择 Python Notebook。运行以下代码拉取 PaddleOCR 并安装依赖:python!git clone https://gitee.com/paddlepaddle/PaddleOCR.git %cd PaddleOCR !pip install -r requirements.txt from paddleocr import PaddleOCR # 初始化模型,开启角度分类,选择中文语言包 ocr = PaddleOCR(use_angle_cls=True, lang="ch") # 进行图片识别 res = ocr.ocr("test.jpg", cls=True) !git clone https://gitee.com/paddlepaddle/PaddleOCR.git %cd PaddleOCR !pip install -r requirements.txt from paddleocr import PaddleOCR # 初始化模型,开启角度分类,选择中文语言包 ocr = PaddleOCR(use_angle_cls=True, lang="ch") # 进行图片识别 res = ocr.ocr("test.jpg", cls=True) 上传自有数据集,执行微调训练脚本,最后导出模型权重。方式 3:API 批量调用(自动化)在控制台找到并复制个人 Access Token。在程序中调用官方接口,将图片转为 Base64 编码传参。接收包含结构化文字、坐标、置信度的 JSON 响应。六、避坑点与注意事项⚠️ 算力时效管理每日发放的算力 24 小时清零。建议:优先消耗快过期的算力;大模型训练建议集中当日算力一次性跑完,不要拆分多天。⚠️ API 额度限制免费每日上限 3000 页。批量处理大批量文件容易触发 429 限流。建议:正式商用业务务必切换到百度智能云付费 OCR 服务。⚠️ 文件大小与存储PDF 限制:网页单 PDF 上限 500 页。图片限制:单图大小不超过 20MB。超大文件处理:建议本地分割后分块上传。存储上限:总存储空间 100G。数据集、模型占用过高会导致无法上传新文件,请定期清理无用图片和权重包。⚠️ 网络与环境问题拉取代码:国内网络偶尔超时,建议切换 百度镜像源。GPU 问题:若遇到 GPU 内核卡死,尝试重启内核即可恢复。⚠️ 微调门槛与商用授权数据标注:自定义数据集需严格规范标注格式,标注错误会导致识别精度暴跌。新手建议优先使用预训练模型推理。授权区分:AI Studio 云端 API 仅用于学习验证;正式商用必须购买百度智能云 OCR 服务;本地开源 PaddleOCR 无商用限制。⚠️ 移动端部署限制AI Studio 仅负责训练和导出模型。注意:无法直接打包 APP,需自行搭配 Paddle Lite 进行移动端部署。附:API 返回极简 JSON 示例json{ "code": 0, "msg": "success", "data": [ { "text_box": [[10,20],[300,20],[300,50],[10,50]], "text": "百度 AI Studio PaddleOCR", "score": 0.987 } ] } { "code": 0, "msg": "success", "data": [ { "text_box": [[10,20],[300,20],[300,50],[10,50]], "text": "百度 AI Studio PaddleOCR", "score": 0.987 } ] }

YOLO图标

YOLO

Ultralytics YOLO 使用指南一、平台介绍1. 文档站定位 Ultralytics 官方中文技术手册,网址为 docs.ultralytics.com/zh。它是 YOLO 系列(v5/v8/v11/YOLO26)全版本的本地代码、云端 Platform 操作、API、部署及许可证规范的完整参考。2. 底层核心架构本地开源框架:Ultralytics YOLO 开源 Python 计算机视觉框架。云端 SaaS 平台:配套 Ultralytics Platform 云端训练、标注、部署服务。场景覆盖:支持本地离线训练 + 云端平台双场景,提供代码示例、参数说明、故障排查及导出教程。二、主要功能1. 开源框架能力(本地代码)视觉任务:覆盖目标检测、实例分割、姿态估计、OBB 旋转框、图像分类 5 大任务。模型尺寸:提供 n/s/m/l/x 多尺寸轻量化预训练模型,支持速度与精度的自由取舍。训练流程:支持一键训练/验证/预测/导出,兼容自定义数据集与 yaml 配置。模型导出:支持 19 种导出格式(TFLite、TensorRT、ONNX、CoreML、OpenVINO 等),完美适配边缘与移动端设备。2. 云端 Ultralytics Platform文档站对该平台功能提供全覆盖指引。AI 辅助标注:集成 SAM3 自动标注技术,支持框/多边形标注。云端训练:提供 H100/B200/5090 等高端 GPU,支持实时指标监控。全球部署:支持全球 43 区域一键云端部署与推理监控。团队管理:具备团队协作、数据集版本管理及 REST API 调用功能。3. 文档站配套功能完整查阅:提供中文 API、命令行、配置参数的完整文档查阅。硬件教程:包含树莓派、安卓、服务器等硬件的部署教程。合规指引:提供许可证区分、商用授权申请指引及常见报错解决方案。三、适用人群✅ 适合人群学生/算法研究者:进行目标检测实验、毕业设计或开源项目开发。视觉开发者:应用于工业检测、安防监控、自动驾驶、机器人识别等领域。中小技术团队:快速落地轻量化视觉方案,支持零代码云端训练。嵌入式工程师:处理模型量化、边缘设备部署相关工作。❌ 不适合人群零 Python 基础用户:若无编程基础且仅想获取开箱即用的商用成品系统。内网隔离单位:无法访问海外云端服务的政企单位(需考虑网络连通性)。四、免费与付费方案1. 开源代码(本地离线)协议:永久免费,遵循 AGPL-3.0 开源协议。核心限制:若用于闭源商用产品或硬件嵌入,必须公开全部项目代码;否则需购买企业商业授权。2. Ultralytics Platform 云端 SaaS 定价定价页面参考:https://www.ultralytics.com/zh/pricing🟢 Free 免费版($0/月)注册福利:赠送$5云训练额度;企业邮箱验证可升级$25。资源限制:100GB 存储、3 并发训练、3 云端部署、100 个模型。服务支持:社区技术支持。🟠 Pro 专业版($29/席位/月)资源升级:500GB 存储、10 并发训练、5 人团队协作、优先客服。额外福利:每月$30 云算力额度。优惠:年付$290 可省 17%。🔵 Enterprise 企业版(定制报价)资源无限:无限存储/训练/部署额度。高级功能:SSO 登录、专属技术支持。核心权益:提供企业商用授权(规避 AGPL 开源强制要求)、本地部署方案。3. 企业商业授权(单独付费)申请页面:https://ultralytix.com/license作用说明:针对商用产品、硬件内置、SaaS 服务等场景,无需开源代码;支持按需定制报价。五、快速使用流程方式 1:本地离线训练(无需登录云端)安装环境:参照文档站教程执行 pip install ultralytics。极简代码训练:pythonfrom ultralytics import YOLO model = YOLO("yolo26n.yaml") model.train(data="coco128.yaml", epochs=100) from ultralytics import YOLO model = YOLO("yolo26n.yaml") model.train(data="coco128.yaml", epochs=100) 模型操作:使用 model.predict() 进行推理,使用 model.export(format="tensorrt") 进行导出。方式 2:云端 Platform(文档站 quickstart 指引)账号准备:在官网注册账号,验证邮箱领取初始算力额度。云端训练:上传数据集 → 使用 AI 标注 → 选择预训练模型启动云端 GPU 训练。模型获取:在浏览器中测试模型效果,支持一键云端部署或下载权重至本地使用。六、避坑指南⚠️ 许可证大坑(最高优先级) AGPL-3.0 协议的传染性极强。若在闭源商用、硬件内置或对外 API 服务场景下不公开源码,存在严重的开源合规纠纷。建议:涉及上述场景,必须购买 Enterprise 企业授权 或进行源码开源。国内网络问题云端平台、预训练权重、文档图片需直连海外,国内下载/加载易慢或超时。建议:本地训练前,建议提前离线下载所需权重文件。免费额度消耗H100/B200 等高端 GPU 计算资源扣费高。建议:实验阶段优先选择低配 GPU 以节省额度。数据集格式报错必须严格遵循 YOLO 格式(txt 标注)。要求:数据集路径不能包含中文或空格,建议使用标准校验脚本进行验证。边缘导出兼容低版本 TensorRT/TFLite 可能不兼容新版 YOLO。建议:查阅文档中的“部署章节”进行版本匹配清单核对。云端并发限制免费版仅支持 3 个并行训练任务。建议:批量实验或运行多项目时,建议升级至 Pro 版以避免排队。本地显存溢出若遇显存不足,可尝试小模型参数:imgsz:缩小分辨率。amp=False:关闭混合精度。建议:查阅文档显存优化章节调整相关参数。云端数据安全风险涉密工业数据集不建议上传海外云端。建议:涉及敏感数据时,优先采用本地离线训练方案。

OpenScreen图标

OpenScreen

OpenScreen 使用指南一、平台简介OpenScreen 是一款开源的轻量级专业录屏演示工具,旨在为用户提供无水印、隐私安全的本地视频处理方案。项目地址:https://github.com/getopenscreen/openscreen官方网址:https://www.openscreen.net/技术架构:基于 Electron 跨平台开发,采用 React + PixiJS,利用本地 FFmpeg 进行视频编码,无云端上传逻辑。核心定位:Screen Studio 等付费软件的免费平替,主打 Demo 演示与教程美化录制。开源协议:MIT 协议,允许个人及商业用途,支持修改与源码分发。二、主要功能特性1. 录制能力录制范围:支持全屏录制或单窗口录制。音频采集:支持麦克风与系统声音同步采集。操作控制:提供 3 秒倒计时,支持托盘悬浮条控制暂停与停止。2. 演示特效(核心卖点)画面增强:支持自动跟随光标缩放、手动定点缩放。流畅转场:内置运动模糊效果,鼠标高亮显示。隐私保护:支持敏感区域自动模糊或打码处理。3. 后期编辑非破坏性剪辑:基于时间轴进行分段变速、裁剪。标注工具:提供文本、箭头、形状等自定义标注功能。背景设置:支持纯色、渐变或自定义壁纸背景。4. 导出设置格式支持:导出 MP4、GIF、WebM 等格式。比例选择:支持 1:1、16:9、9:16 等多尺寸比例。纯净输出:无水印、无隐藏收费、无强制广告。5. 扩展支持源码修改:支持二次编译修改源码。素材导入:支持导入外部录屏素材进行二次编辑。三、适用人群与场景✅ 推荐使用的用户程序员:用于代码 Demo 演示、Bug 复现过程记录、开源项目讲解。产品/运营:制作软件演示视频、客户交付短视频、功能介绍素材。讲师/自媒体:制作操作教程、软件测评视频、线上课程内容。自由职业者:低成本商用演示视频,替代昂贵的付费软件。❌ 不太适合的场景专业影视制作:不适合多轨道复杂剪辑或专业级调色需求。直播推流:不支持直接推流或直播场景。超长录制:长时间 4K 连续录制存在资源占用风险。云端协作:不适合需要云端存储或在线实时分享链接的团队。四、免费与付费情况完全永久免费,无任何付费套餐、订阅、内购或专业版限制。功能全开:所有功能均开放,无功能阉割,无录制时长限制。商用免费:依据 MIT 协议,个人及商业用途均免费。纯净无广告:无隐藏收费、无强制广告、无个人隐私数据采集。五、极简使用步骤1. 安装软件预编译包(推荐):访问 GitHub Releases 下载对应系统安装包。macOS:.dmgWindows:.exeLinux:AppImage包管理器安装: macOS 用户可通过 Homebrew 一键安装:bashbrew install openscreen brew install openscreen 源码构建:bashgit clone https://github.com/getopenscreen/openscreen cd openscreen npm install npm run build git clone https://github.com/getopenscreen/openscreen cd openscreen npm install npm run build 2. 权限配置(重要)macOS:授予屏幕录制、辅助功能、磁盘权限。若弹出隔离提示,在终端执行以下命令放行:bashxattr -rd com.apple.quarantine /Applications/OpenScreen.app xattr -rd com.apple.quarantine /Applications/OpenScreen.app Linux:赋予 AppImage 执行权限:chmod +x xxx.AppImage启动时建议添加 --no-sandbox 参数以防崩溃。Windows:需在系统设置中允许应用屏幕捕获,关闭杀毒软件拦截规则。3. 录制流程设置:打开软件,选择「窗口」或「全屏」录制范围,配置音频源。录制:点击 Record 按钮,通过悬浮条控制录制过程。编辑:录制结束后进入时间轴,添加缩放特效、标注、裁剪、调速或更换背景。导出:设置分辨率与比例,导出为 MP4/GIF 并保存至本地。六、常见避坑与注意事项⚠️ 版本与稳定性Beta 测试:Windows 版在暂停后可能出现鼠标错位,长时间录制建议分段录制以防内存溢出。GIF 导出:高分辨率 GIF 导出耗时较长,请保持网络畅通或定期清理磁盘空间。⚠️ 系统兼容性macOS 系统音:macOS 12 及以下版本无法直接捕获系统音,需安装 BlackHole 等虚拟声卡;新版本需手动在系统设置中开启音频权限。macOS 拦截:首次打开若被 Gatekeeper 阻止,必须执行隔离删除命令。语言界面:首次启动可能出现语言弹窗遮挡界面,建议将弹窗拖至边缘切换简体中文后关闭。⚠️ 隐私与安全本地处理:所有视频文件均在本地处理,不上传至云端。敏感信息:软件无自动敏感信息检测,涉及机密内容需手动添加模糊遮罩。⚠️ 二次开发协议声明:若修改源码后分发,务必保留 MIT 协议声明。功能限制:不支持对接云端存储或生成在线分享链接。⚠️ 功能边界缺失功能:暂无自动字幕、多轨道混音、复杂转场特效、摄像头画中画等功能,直播推流也不支持。

Xinference图标

Xinference

Xinference平台使用指南一、平台介绍全称Xorbits Inference定义开源本地/私有化大模型推理服务框架核心优势部署灵活:支持单机或集群均可部署,内置 WebUI。接口统一:对外全兼容 OpenAI 接口,便于迁移。模型统一:统一托管 LLM、多模态、语音、向量、重排模型,替代 Ollama+vLLM 多套工具。数据安全:数据完全本地不出内网,主打企业私有化 AI 底座。二、核心主要功能全品类模型托管 支持 300+ 开源模型(如通义千问、Llama、GLM、Whisper、LLaVA 等),涵盖 LLM、图文多模态、语音 ASR/TTS、Embedding、Rerank 等场景。多推理引擎加速 支持 vLLM、SGLang、llama.cpp、Transformers 等引擎。内置 AWQ、GPTQ、FP8 量化技术,具备分离式 Prefill-Decode 以提升吞吐量。OpenAI 兼容统一 API 提供 /v1/chat/completions、音频、向量等接口。原有 GPT 代码仅需修改 base_url 即可无缝迁移。分布式集群调度 支持多机异构部署(如 GPU、昇腾、M 系列苹果芯片混布),兼容 K8s 并支持弹性扩缩容。配套开发能力 提供 Web 可视化管理、函数调用 Function Calling、基础监控指标。支持 Docker 一键部署,并可无缝对接 LangChain、Dify、FlowUs 等平台。企业级商业特性 具备多租户、权限管控、私有模型仓库、SLA 保障、GDPR/HIPAA 合规认证,以及国产硬件适配。三、适用人群✅ 适合使用个人开发者/学生:适合本地跑开源模型做测试、搭建 RAG 原型。AI 研发/算法团队:作为统一推理底座,用一套 API 管理全部模型。中小企业:适合私有化知识库、客服 AI、离线业务,规避公有 API 成本与数据泄露风险。MLOps 运维:适合搭建本地推理集群,统一调度多 GPU 资源。合规行业(金融/政务):满足数据禁止出内网场景的安全需求。❌ 不适合使用无 GPU/低配设备:无 GPU 或低配轻薄本运行 7B+ 大模型时,速度极差。纯云端需求用户:只想开箱即用云端对话、无本地部署能力的普通用户。超大规模高并发:超大规模公有云高并发商用场景,建议优先选择专业云推理服务。四、免费&付费方案📚 定价官方页面国际站:https://xinference.co/pricing国内中文站:https://xinference.cn/pricing1. 开源免费版(永久免费)授权:MIT 开源,个人/小型商用均可自由部署。功能:单机部署、基础 WebUI、全部推理引擎、OpenAI API、社区文档支持。调用额度:无调用额度限制。限制:无集群支持、无权限管控、无商业售后、不支持国产 NPU 深度适配、无 SLA 保障。2. 企业单机商业版(付费授权)适用:单机生产环境。功能:权限管理、单点登录、国产芯片深度适配、7×12 技术支持、安全审计、私有模型库。限制:不支持多机分布式集群扩展。3. 企业集群商业版(付费授权)适用:大型生产环境、多机集群。功能:全功能 + 多机分布式、弹性伸缩。高可用 Supervisor、K8s Helm、专属技术顾问。SLA 保障、多租户隔离、合规审计。五、快速使用步骤1. 安装(三选一)方式一:pip 完整安装(推荐)bashpip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple 方式二:Docker 部署bashdocker pull xprobe/xinference:latest-cu129 docker run -d -p 9997:9997 xprobe/xinference:latest-cu129 docker pull xprobe/xinference:latest-cu129 docker run -d -p 9997:9997 xprobe/xinference:latest-cu129 2. 启动服务本地单机(开放局域网访问)bashxinference-local --host 0.0.0.0 --port 9997 xinference-local --host 0.0.0.0 --port 9997 访问 WebUI:http://localhost:9997/ui3. 加载模型WebUI 操作:在 Model Hub 搜索模型 → Launch,自动下载权重。CLI 命令:bashxinference launch --model-name qwen2:7b --n-gpu 1 xinference launch --model-name qwen2:7b --n-gpu 1 4. API 调用示例(兼容 OpenAI)pythonfrom openai import OpenAI client = OpenAI( base_url="http://127.0.0.1:9997/v1", api_key="dummy" # 开源版无需密钥 ) resp = client.chat.completions.create( model="qwen2:7b", messages=[{"role":"user", "content":"介绍 Xinference"}] ) print(resp.choices[0].message.content) from openai import OpenAI client = OpenAI( base_url="http://127.0.0.1:9997/v1", api_key="dummy" # 开源版无需密钥 ) resp = client.chat.completions.create( model="qwen2:7b", messages=[{"role":"user", "content":"介绍 Xinference"}] ) print(resp.choices[0].message.content) 六、避坑点(注意事项)硬件门槛7B 模型最低建议 32G 内存。无 GPU 仅 CPU 推理速度极慢。Windows 原生支持较差,建议 WSL2 / Linux / macOS M 系列。模型下载慢国内 HuggingFace 源容易超时。建议手动配置 HF 镜像或提前本地缓存权重。资源调度缺陷多模型同时加载显存抢占严重。长文本生成会挤压 Embedding/Rerank 模型资源。建议分机部署轻重模型。分布式运维复杂集群版依赖 DeepEP 通信库,跨机型兼容性差。小规模项目优先选择单机部署。版本依赖冲突xinference[all] 安装易出现 torch/cuda 版本不匹配。建议按需安装 [vllm] / [transformers] 精简依赖。存储占用巨大模型缓存默认存在用户目录。单 7B 量化模型可达 10GB+,建议通过 XINFERENCE_HOME 环境变量自定义存储路径。安全风险开源版无权限隔离,公网暴露 9997 端口存在风险。生产环境必须加反向代理 + 鉴权。多模态生态不完善文生图、视频生成支持模型较少。专业图像生成建议搭配独立 Stable Diffusion 服务。冷启动耗时首次加载大模型预热时间长。生产环境建议常驻模型,避免频繁启停。商业付费渠道国际版订阅仅境外信用卡支付。国内企业需走线下销售签约。

GPUStack图标

GPUStack

GPUStack使用指南一、平台介绍GPUStack 是一款开源的异构 GPU 集群 + 私有大模型推理管理平台。核心定位:统一纳管 NVIDIA/AMD/Apple Silicon/昇腾/摩尔线程等异构显卡,支持一键部署 LLM/多模态/文生图/语音模型,提供 OpenAI 兼容 API,是本地私有化 AI 推理的理想底座。部署方式:可替代单独部署 vLLM、llama.cpp、SD 服务等,支持 Linux/macOS/Windows(WSL2) 单机及多机集群。基础功能:内置调度、监控、权限管理、负载均衡及故障自愈机制。开源属性:100% 开源免费,支持私有化部署。资源链接:官网:https://gpustack.ai开源仓库:https://github.com/gpustack/gpustack二、主要功能1. 异构算力统一纳管支持多品牌显卡及多服务器合并为单集群。具备自动分配显存/算力能力,支持分布式推理。2. 全品类模型一键部署模型类型:涵盖 LLM/VLM/Embedding/Rerank/文生图/STT/TTS。下载便捷:直连 Hugging Face/ModelScope 自动下载,内置 GGUF/FP16 量化模板。3. 多推理引擎兼容支持 vLLM、llama-box(llama.cpp)、MindIE、SD.cpp 共存与切换。用户可根据需求调节吞吐率或低延迟模式。4. OpenAI 标准 API兼容 Chat Completions、图像生成接口。可无缝对接 Dify、LangChain、Agnes AI 或本地客户端。5. 运维管控能力提供 GPU 实时监控与用量统计。管理 API 密钥、用户权限、Token 限流及请求配额。支持高可用故障转移功能。6. 内置模型市场 Catalog预调好主流开源模型参数,无需手动填写显存或上下文配置,开箱即用。三、适用人群✅ 适合使用个人开发者/AI 爱好者:本地单机显卡跑私有大模型。算法团队:构建私有化 RAG、Agent、本地知识库底座。中小企业:自建离线 AI 服务,有效规避公有 API 数据泄露风险。算力运维人员:管理多服务器异构 GPU 统一集群。国产化需求方:实现昇腾/摩尔线程国产 NPU 的统一调度。❌ 不适合使用纯小白用户:缺乏 Linux 或 Docker 基础,部署有一定门槛。无硬件资源用户:无本地 GPU 或云显卡资源。C 端交互需求者:追求开箱即用的网页对话工具(平台侧重推理底层,无完善的 C 端交互界面)。四、免费 & 付费定价1. 开源核心:永久完全免费适用范围:所有基础集群、模型部署、API、监控功能无限制。限制说明:无节点/显卡数量锁死,本地私有化部署无按量扣费。2. 商业付费:企业增值服务产品形态:官方企业版,针对企业场景提供专属服务。服务包含:专属技术支持、私有化定制。SLA 保障、国产芯片深度适配。企业权限审计、离线交付包。获取方式:定价页面:https://gpustack.ai/pricing模式:按节点/服务器年度订阅,支持上门部署、7×24 工单。定制:需联系销售获取定制报价。3. 特别说明目前无云端 SaaS 版,仅支持本地私有化部署。无网页在线试用平台,必须自备显卡硬件。五、快速使用步骤方式 1:Docker 一键部署(推荐)环境准备:安装 Docker + NVIDIA Container Toolkit 显卡驱动。执行安装:运行官方安装脚本 curl -sfL https://get.gpustack.ai | sh。访问控制台:浏览器访问 http://本机 IP:80,默认账号 admin / 密码 GPUStack@123。构建集群:新建集群,添加本地 Worker 节点(系统自动生成接入命令供其他服务器使用)。部署模型:点击 Deploy Model → 选择 HF/ModelScope → 选量化规格 → 启动。获取 API:复制 API 地址 + 密钥,接入任意 OpenAI 兼容客户端。方式 2:Windows 部署前提条件:必须使用 WSL2 + Docker Engine。注意:不支持原生 Docker Desktop,否则会导致显卡直通异常。驱动要求:主机安装 NVIDIA 驱动,WSL 内部无需安装 CUDA Toolkit。调用 JSON 示例(兼容 OpenAI)接口地址:http://127.0.0.1:80/v1json{ "model": "qwen3-7b-instruct", "messages": [ { "role": "user", "content": "介绍 GPUStack" } ], "temperature": 0.7 } { "model": "qwen3-7b-instruct", "messages": [ { "role": "user", "content": "介绍 GPUStack" } ], "temperature": 0.7 } 六、避坑重点显存估算坑 vLLM 默认占用 90% 显存,多模型易冲突。计算公式:模型权重 GB × 1.2 + 2GB。后果:显存不足会持续 Pending 无法启动。国内模型下载慢解决方法:部署前配置 HF 镜像环境变量 HF_ENDPOINT=https://hf-mirror.com。否则:下载超时失败。Windows 原生不兼容严禁:不要直接 Windows 安装。必须:使用 WSL2,Docker Desktop 会导致显卡直通异常。多节点网络坑跨服务器:需开放 80 端口,内部通信端口需放行。防火墙:局域网访问 WSL 需开启 Mirrored 网络模式。密钥安全风险:API Key 仅控制台可见一次,泄露会被滥用占用显卡资源。建议:按团队分配独立 Token 配额。版本升级风险架构:大版本(如 v1→v2)可能涉及架构重构。操作:升级前导出模型配置备份,生产环境不建议自动更新。国产芯片适配建议:昇腾/摩尔线程优先使用对应专用驱动。注意:通用 N 卡引擎在这些芯片上性能下降明显。无在线云端现状:无法网页在线试用,必须自备显卡硬件,无云算力租赁服务。免费无售后开源版:无官方技术支持,报错只能查 GitHub Issues。建议:企业稳定场景建议购买商业服务以获取工单支持。

LM Studio图标

LM Studio

LM Studio 使用指南一、平台介绍LM Studio(lmstudio.ai)是一款功能强大的本地离线大模型桌面 GUI 工具,全面支持 Windows、macOS 和 Linux 全平台。核心定位:可视化管理 GGUF 开源大模型,替代 Ollama 纯命令行操作。数据隐私:支持全程本地运行,不联网上传数据,拒绝云端计费与 Token 消耗。技术栈:内置兼容 OpenAI/Anthropic 本地 API 服务,支持 RAG 文档问答及远程实例连接(LM Link)。适用场景:隐私优先、离线免费体验、无云端依赖的本地 AI 工作流。二、核心主要功能1. 模型市场一键检索下载:支持 Llama3、Qwen、DeepSeek、Mistral 等主流开源模型。量化格式:专注于 GGUF 量化模型,支持手动导入本地 GGUF 文件。版本选择:提供不同量化版本(如 Q4_K_M),平衡速度与效果。2. 可视化对话图形化窗口:提供直观的用户聊天界面,支持流式输出。参数调节:可调整 Temperature(温度)、上下文长度(Context Window)、GPU 分层卸载(GPU Layers Offload)等推理参数。3. 本地 RAG(检索增强生成)私有文档问答:支持上传 PDF、TXT、Markdown 等格式。本地知识库:构建本地私有文档问答系统,文件数据不出本地。4. 兼容 API 服务本地接口:一键启动 OpenAI 格式本地接口,地址默认为 http://localhost:1234/v1。生态对接:可直接对接任何支持 OpenAI 协议的客户端、脚本或代码库。5. 远程算力连接LM Link:支持局域网或公网连接另一台设备的 LM Studio 算力。资源共享:将远程模型加载到当前会话,共享远端模型资源。6. 命令行工具 (lms)无 GUI 部署:支持无图形界面服务器部署。自动化脚本:支持脚本批量加载模型、自动化推理任务。7. 模型量化工具内置量化:提供模型压缩与量化工具,降低内存与显存占用。三、适用人群✅ 适合用户用户类型核心需求匹配理由隐私需求用户处理合同、源码、涉密文档数据全程本地化,拒绝上传外网AI 新手不想敲命令行图形化界面跑本地大模型,门槛低独立开发者本地调试 AI 应用低成本 API 原型开发,无需云调用学生/爱好者离线免费体验无调用额度限制,资源免费小型技术团队单人私有化 AI 工作台本地部署,灵活控制环境❌ 不适合用户用户类型限制原因低配电脑无 16G 内存/独立显卡(7B 基础模型最低需 10G 内存)大规模集群无原生团队权限管理,不适合企业多人协作云端依赖者不愿占用本地硬盘(模型单文件几 GB~几十 GB)四、免费&付费定价(最新)1. 个人/职场标准版(永久全免费)功能完整:无功能阉割、无模型数量上限、无水印、不限使用时长。商业授权:个人及公司内部商用均可免费使用,无需额外购买授权。功能包含:包含全部 GUI、本地 API、RAG、LM Link、lms 命令行全部功能。2. Enterprise 企业版(付费定制)面向群体:大型企业级需求。核心优势:集中模型管控、SSO 登录、私有模型仓库、管理员权限、专属技术支持。获取方式:无公开定价,需联系官方销售询价。官网定价/企业咨询入口:https://lmstudio.ai/enterprise五、极简使用步骤下载安装:访问官网下载对应系统客户端,启动后切换至简体中文界面。下载模型:在 Model 市场搜索模型,优先选择 Q4_K_M 量化版本(平衡速度/效果)。加载模型:下载完成后点击加载,设置 GPU 卸载层数(有 N 卡/Apple 硅尽量开满)。开始对话:进入 Chat 页面直接对话;如需 API,点击 Developer 标签启动 Local Inference Server。调用 API:接口地址:http://127.0.0.1:1234/v1请求兼容:OpenAI 请求 JSON 格式。API 示例 JSON:json{ "model": "qwen3-7b-q4_k_m", "messages": [ {"role": "user", "content": "写一段本地 API 调用说明"} ], "temperature": 0.7 } { "model": "qwen3-7b-q4_k_m", "messages": [ {"role": "user", "content": "写一段本地 API 调用说明"} ], "temperature": 0.7 } 本地 RAG:点击 Chat with Docs,上传本地文件后绑定模型进行问答。六、避坑点📡 下载网络坑问题:国内直连 Hugging Face 模型市场极慢或失败。对策:建议手动去魔搭(ModelScope)或 Hugging Face 下载 GGUF 文件后,使用“导入”功能本地上传。🖥️ 硬件性能坑内存配置:8G 内存仅能跑 3B 极小模型。推荐配置:16G 内存推荐 7B Q4 量化,32G 以上可尝试 14B/34B 模型。显存优化:不开启 GPU 分层卸载,CPU 推理速度极慢且卡顿,务必在界面开启 GPU 层数。📦 模型格式坑格式限制:软件仅支持 GGUF 格式。GPTQ、Safetensors 等格式无法直接加载。解决:如需使用其他格式,需先转换为 GGUF(可使用 llama.cpp 或类似工具转换)。🌐 API 连接坑端口占用:防火墙或代理可能占用 1234 端口。影响:导致本地服务无法访问。解决:关闭占用程序、关闭防火墙或修改 API 端口。💾 磁盘占用坑空间消耗:单 14B 模型即占用 10GB+,多模型极易占满硬盘。维护:建议定期删除不用的模型文件,或使用 LM Link 共享模型而非重复下载。🔒 隐私误区软件安全:软件本身不上传对话记录。版权风险:第三方模型权重需自行核对商用版权,注意模型协议(如非商用协议)。🔗 远程连接坑LM Link 公网:公网连接需手动放行端口,无加密措施易泄露。建议:涉密场景请仅限局域网使用 LM Link。🏢 企业部署限制免费版:无多人权限、无日志审计。合规需求:公司合规场景需购买 Enterprise 版。🔄 更新配置坑版本更新:大版本更新偶尔会重置模型加载配置(如 GPU 层数)。建议:更新前请记录当前的推理参数设置。

vLLM图标

vLLM

vLLM使用指南一、平台介绍vLLM 是由伯克利 LMSYS 开源的高性能大模型推理与服务引擎,访问官网 vllm.ai。其核心主打 PagedAttention 分页注意力 技术,大幅降低了 KV 缓存的显存占用。相比原生 Transformers,其吞吐量可提升 10~15 倍。vLLM 主要分为两种形态:开源本地部署版免费开源,无授权费。适用于本地环境、私有云自建推理服务。成本仅为用户自有的 GPU/云服务器硬件开销。vLLM Cloud 托管云服务官方提供的托管 GPU 在线 API。按需付费或订阅模式。核心优势:兼容 OpenAI 标准接口。支持连续批处理(Continuous Batching)。极低显存浪费。适配几乎所有主流开源大模型。二、主要功能超高吞吐推理 基于 PagedAttention 与连续批处理,单 GPU 可承载更多并发对话,显著降低单 Token 成本。支持量化(AWQ/GPTQ/SqueezeLLM)以节省显存。OpenAI 兼容 API 服务 一键启动标准 /v1/chat/completions 接口。现有 OpenAI 代码无需大幅修改即可迁移,且内置 Swagger 调试页面。全模型生态支持 兼容 Llama、Qwen、DeepSeek、Gemma 等主流架构。支持多模态(LLaVA)、MoE 混合专家模型、代码模型以及 LoRA 动态加载。分布式扩容 支持单卡/多卡张量并行,以及 Ray 多机分布式部署。具备自动前缀缓存功能,大幅提升重复上下文的处理速度。多模态原生 原生支持图文 LLaVA、音频输入及百万 Token 级别的长上下文窗口。可观测指标 提供吞吐、延迟、KV 缓存利用率、排队长度等 metrics,支持对接 Prometheus 监控系统。容器化一键部署 官方提供 Docker 镜像,支持 CPU、CUDA、ROCm 及 Apple Silicon 等多种硬件环境。三、适用人群✅ 适合AI 开发者与算法工程师:需要自建私有大模型服务。中小团队/创业公司:日处理千万级 Token,希望降低第三方 API 费用。私有化部署需求:要求数据不出本地或企业内网的企业。开源模型微调与 RAG:作为本地知识库推理底座。多模态与高并发场景:需要低延迟、高并发对话的产品。❌ 不适合资源受限者:无 GPU 资源且无运维能力的纯小白用户。低调用量场景:日调用量低于 10 万 Token,自建 GPU 成本高于商用 API。零代码用户:完全不想运维,只想开箱即用的 C 端用户(需自行开发前端)。四、免费&付费、定价页面地址1. 开源本地版(永久免费)协议:MIT 协议,无授权费。限制:无并发、Token、时长限制,数据完全私有。成本:仅硬件(GPU/云服务器)开销。2. vLLM Cloud 托管云(付费按量/订阅)定价页面:https://vllm.ai/pricing收费模式按量付费(Pay-as-you-go):按输入/输出 Token 计费,单价视模型不同。预留实例订阅:按月包 GPU 算力,适合高并发场景,单价更低。附加收费:跨区流量、超大显存(如 H100)、专属运维 SLA。参考成本(以官网为准)7B 量化模型:约 $0.05~0.12 / 百万 token。70B 大模型:约 $0.3~0.8 / 百万 token。自建建议:日处理千万 Token 以上时,自建 GPU 更划算。五、快速使用教程路线 1:本地开源部署(免费)环境准备需 Python 3.10+ 及 NVIDIA GPU(支持 CUDA)。命令示例:uv pip install vllm启动服务 启动兼容 OpenAI 的服务,监听端口 8000:bashvllm serve Qwen/Qwen2.5-7B-Instruct --host 0.0.0.0 --port 8000 vllm serve Qwen/Qwen2.5-7B-Instruct --host 0.0.0.0 --port 8000 调用示例 使用标准 OpenAI JSON 请求格式:json{ "model": "Qwen/Qwen2.5-7B-Instruct", "messages": [ {"role": "user", "content": "介绍 vLLM"} ], "temperature": 0.7, "stream": true } { "model": "Qwen/Qwen2.5-7B-Instruct", "messages": [ {"role": "user", "content": "介绍 vLLM"} ], "temperature": 0.7, "stream": true } 访问调试文档地址:http://localhost:8000/docs路线 2:vLLM Cloud 托管云注册账号:前往官网注册并充值。配置控制台:选择模型与 GPU 规格,获取 API Key 与 Base URL。接入调用:在客户端(如 Python SDK)中直接替换 base_url 与 api_key 即可调用,无需管理底层 GPU。六、避坑点(核心干货)显存硬门槛7B 模型 FP16 精度需 ≥24GB 显存。70B 模型建议配备 80GB A100/H100。无量化直接运行容易 OOM,务必开启 AWQ/GPTQ 量化。国内网络两大坑模型下载:HuggingFace 直连超时,建议配置镜像 HF_ENDPOINT=https://hf-mirror.com。Cloud 延迟:vLLM Cloud 为海外节点,直连延迟高,国内业务建议优先采用本地部署。免费开源≠零成本低调用量场景(如日<100 万 Token)下,云 GPU 时租费用可能高于 OpenRouter 等按量 API。日 Token 量建议门槛较高,需计算 ROI。批量并发限流坑默认 max-num-seqs 有限制。超高并发需调大该参数,否则会出现请求排队、首 token 延迟飙升。多卡分布式踩坑多机部署需配置 Ray + NCCL,裸跑易通信报错。单机多卡需添加 --tensor-parallel-size N 参数。KV 缓存内存泄漏超长上下文或频繁唯一 Prompt 可能击穿缓存。建议设置 max-model-len 截断异常输入。Cloud 托管隐性费用预留实例按月付费,闲置仍扣费。超大带宽出网流量可能单独计费,预算需预留。无原生 Web 聊天界面vLLM 仅提供 API 后端。前端、鉴权、会话存储需自行开发,不适合零代码直接给业务使用。商用版权风险Llama 等模型需单独申请 Meta 商用授权。vLLM 仅为推理引擎,不提供模型本身的商用许可。

LocalAI图标

LocalAI

LocalAI 免费开源本地 AI 推理框架一、平台介绍官网地址:https://localai.io核心仓库:https://github.com/mudler/LocalAI协议说明:开源 MIT 协议,全免费。核心优势:🛡️ 隐私安全:离线本地/私有化运行,所有数据本地处理,绝不上传第三方。🤝 接口兼容:全兼容 OpenAI / Anthropic 接口,直接替换云端 API。🖥️ 硬件支持:支持 CPU / GPU / 分布式集群,适配 NVIDIA/AMD/Intel/Vulkan。⚡ 无限制服务:无厂商用量限速,无 Token 计费,无过期期限。🧩 多模态支持:支持文本、语音、图像、代码等全栈模型推理。二、主要功能1. 文本 LLM 推理兼容模型:Llama3、Qwen、Mistral、RWKV、CodeLlama 等。核心能力:Function Calling(函数调用)流式输出(Streaming)长上下文(Long Context)JSON 结构化返回定位:可直接作为本地 ChatGPT 替代方案。2. 多模态统一 API文生图/图生图:支持 Stable Diffusion 类模型。语音识别:Whisper 语音转文字。语音合成:TTS 语音克隆。图像理解:图像识别 Embedding、重排序 Rerank。3. 配套生态内置LocalAGI:本地智能 Agent 框架。LocalRecall:本地向量知识库,可搭建离线 RAG 检索增强系统。4. 部署与扩展部署方式:Docker 一键启动、二进制包、源码编译、K8s 部署。集群支持:支持单机多模型、P2P 横向扩容。5. Web 管理面板访问入口:http://localhost:8080功能:可视化下载模型、对话调试、参数配置、接口测试。三、适用人群✅ 适合使用开发者:本地调试 AI 应用、私有代码知识库、低成本 API 服务。政企/合规行业:金融、医疗、政务等敏感数据禁止外发云端场景。隐私敏感用户:希望离线使用,拒绝对话数据被厂商采集训练。小团队/工作室:自建内部 AI 工具,节省月度 API 订阅费。运维/私有化工程师:搭建内网离线 AI 服务。❌ 不适合使用纯小白用户:无 Docker、Linux 命令行基础。硬件受限:无闲置硬件(建议 8G 内存起步,大模型需 16G+)。追求极致效果:本地硬件上限低,无法跑顶级超大参数量模型或追求顶级画质。四、免费与付费详情⚠️ 重要区分提示 localai.io 是核心开源框架(完全免费); localai.world 是官方商业咨询/定制工具商店(付费增值服务)。 不需要付费也能完整使用 LocalAI 核心能力。1. 核心框架(100% 免费)开源代码、全部推理 API、Web 面板、多模型支持均无限制。无 Token 计费、无调用额度、无过期期限。仅消耗本机硬件资源,无平台服务费。2. 付费增值服务(非强制,按需选择)定价页面:https://localai.world/shop/定制工具:定制私有化 AI 工具(如法律助手),单品买断($10 ~ €39)。咨询服务:技术咨询服务券(€200)。企业定制:企业私有化定制开发包(数千美元级)。五、快速使用步骤(推荐 Docker)1. 基础 CPU 版启动bashdocker run -p 8080:8080 --name local-ai localai/localai:latest-cpu docker run -p 8080:8080 --name local-ai localai/localai:latest-cpu 2. NVIDIA 显卡加速版启动bashdocker run --gpus all -p 8080:8080 localai/localai:latest-gpu-nvidia-cuda-12 docker run --gpus all -p 8080:8080 localai/localai:latest-gpu-nvidia-cuda-12 (注:AMD/Intel 显卡需使用对应标签的镜像)3. 持久化存储(防止重启丢失模型)务必挂载本地目录存储模型,否则重启容器后模型会清空:bashdocker run -p 8080:8080 --name local-ai -v ./models:/models localai/localai:latest-gpu docker run -p 8080:8080 --name local-ai -v ./models:/models localai/localai:latest-gpu 4. 访问与管理浏览器访问管理面板:http://localhost:8080在面板中下载 GGUF 量化模型(推荐)。复制本地 OpenAI 兼容调用地址:http://localhost:8080/v1在任意客户端(如 OpenWebUI、Agnes AI、Python 脚本)填入该地址即可调用。5. 标准请求 JSON 示例json{ "model": "qwen-7b-chat-q4_k_m", "messages": [ { "role": "user", "content": "介绍 LocalAI" } ], "temperature": 0.7, "stream": false } { "model": "qwen-7b-chat-q4_k_m", "messages": [ { "role": "user", "content": "介绍 LocalAI" } ], "temperature": 0.7, "stream": false } 六、避坑指南1. 模型丢失坑 📉现象:容器删除或重启后,所有模型消失。解决:部署时必加卷挂载参数 -v ./models:/models。2. 硬件性能坑 🖥️现象:CPU 跑 7B 模型卡顿严重、内存溢出。建议:优先使用 Q4_K_M 量化 GGUF 模型;13B 模型建议≥16G 内存,34B≥24G 显存。3. 国内下载失败 📴现象:官方模型源在海外,国内下载慢或中断。解决:手动下载 GGUF 文件放入本地 models 文件夹即可。4. 端口访问与鉴权 🔒外网/局域网:访问需放行 8080 端口。安全性:无鉴权默认开放,生产环境必须配置 API Key 鉴权或防火墙。5. 文档与扩展 🔍现象:高级配置、分布式、RAG 文档不全。解决:遇到问题优先查阅 GitHub Issues 或社区 Wiki。6. 显卡兼容性 🎮现象:AMD/Intel 使用 nvidia 镜像导致无法识别 GPU。解决:根据显卡品牌选择对应标签的 Docker 镜像(WSL 需额外配置)。7. 并发崩溃 OOM 💥现象:多客户端同时调用导致内存爆炸崩溃。解决:设置环境变量限制并发请求数 MAX_ACTIVE_REQUESTS。8. 商用版权 ⚖️注意:框架本身免费开源,但下载的 LLM/图像模型需遵守对应协议。行动:商用前请自行审核模型授权。9. 网络误区 🌐概念:框架本身可离线,但首次下载模型必须联网。场景:模型下载完成后,断网即可全功能运行。10. 付费站点混淆 💸警告:localai.io 是开源官网;localai.world 是付费商城。建议:非企业定制需求,无需付费。

Ollama图标

Ollama

Ollama使用全指南一、平台介绍Ollama 是一款开源的本地大模型运行管理器。它支持一键部署 GGUF 量化 LLM,并自动适配 NVIDIA、AMD 及 Mac Metal 等硬件加速。所有推理均在本地离线执行,确保数据不上传至第三方服务器,无云端托管、无在线 SaaS 服务。核心定位:纯本地客户端程序,无在线后台。模型库地址:https://ollama.com/library核心优势:数据隐私安全,完全断网可用,规避 API 费用。二、主要功能极简模型管理支持单行命令进行拉取、运行、删除、导出模型。自动进行 4bit/8bit 量化压缩,显著降低硬件门槛。跨平台全适配完美支持 Windows、macOS、Linux 系统。即使无独立显卡,CPU 亦可运行轻量级模型。OpenAI 兼容 API本地端口默认为 11434。可无缝对接 Dify、AnythingLLM、LangChain 及自定义代码。离线对话支持断网环境下完全离线使用 AI。提供命令行交互式聊天模式。自定义模型封装支持编写 Modelfile。可自定义微调提示词、参数设置及上下文长度。硬件自动调度自动识别显卡显存。支持负载均衡,可限制 CPU/内存占用,防止资源耗尽。批量服务支持后台常驻 ollama serve。允许多个程序并发调用本地模型。三、适用人群✅ 适合场景开发者:构建本地 RAG、Agent、AI 工具原型,规避云端 API 费用与数据泄露风险。办公/学生:本地私密写作、代码生成、知识库构建,敏感文档不传到外网。私有化团队:内网服务器部署,实现企业数据本地闭环。AI 爱好者:低成本测试 Llama3、Qwen、DeepSeek、Mistral 等开源模型。离线场景:网络受限或无网络环境下使用 AI。❌ 不适合场景高并发公网商用服务:并发性能弱于 vLLM 或 TGI,不适合大规模公网 API 接口。无本地电脑用户:仅希望网页在线聊天的用户。文生图/视频需求:Ollama 主打文本大模型,原生多模态支持有限。四、免费&付费、定价页面💰 收费规则(全程 100% 免费无付费套餐)软件本体:开源免费,无订阅、无 Token 计费、无会员、无功能锁。模型资源:全部免费下载,仅消耗本地硬盘与内存资源,无任何线上扣费。商业定位:无官方云服务,因此不存在定价页面。官方说明:Ollama 是本地开源工具,无付费商业套餐,官网无 pricing 页面。🔗 官方关键链接官网主页:https://ollama.com下载页:https://ollama.com/download模型库:https://ollama.com/library官方文档:https://docs.ollama.com五、如何使用(极简步骤)1. 安装软件Windows:官网下载 exe 安装包。macOS:下载 dmg 或执行 brew install ollama。Linux:执行 curl -fsSL https://ollama.com/install.sh | sh。验证安装:终端执行 ollama --version。2. 拉取模型bashollama pull qwen2:7b # 中文 7B 通用 ollama pull llama3:8b # 英文通用 ollama pull codellama:7b # 代码专用 ollama pull qwen2:7b # 中文 7B 通用 ollama pull llama3:8b # 英文通用 ollama pull codellama:7b # 代码专用 3. 命令行对话bashollama run qwen2:7b # 输入问题,输入 /bye 退出对话 ollama run qwen2:7b # 输入问题,输入 /bye 退出对话 4. 启动 API 服务bashollama serve # API 地址 http://localhost:11434/v1 # 兼容 OpenAI 请求格式 ollama serve # API 地址 http://localhost:11434/v1 # 兼容 OpenAI 请求格式 注意:默认仅监听本机访问。5. 常用管理命令bashollama list # 查看本地模型 ollama rm qwen2:7b # 删除模型 ollama ps # 查看运行中模型 ollama list # 查看本地模型 ollama rm qwen2:7b # 删除模型 ollama ps # 查看运行中模型 6. API 请求 JSON 示例json{ "model": "qwen2:7b", "messages": [ {"role":"user","content":"简要介绍 Ollama"} ], "temperature": 0.7, "stream": false } { "model": "qwen2:7b", "messages": [ {"role":"user","content":"简要介绍 Ollama"} ], "temperature": 0.7, "stream": false } 六、避坑点国内模型下载极慢模型源在海外,大文件易中断。解决方案:配置终端代理、离线手动导入 GGUF 模型文件。C 盘爆满模型默认存储于 C:\Users\用户名\.ollama\models。解决方案:提前设置环境变量 OLLAMA_MODELS 迁移至其他磁盘。硬件门槛踩坑7B 模型最低建议 8G 内存,13B 建议 16G。无独显 CPU 运行速度极慢,大模型易卡顿死机。局域网/远程无法访问 API默认仅监听 127.0.0.1。解决方案:启动服务前配置环境变量:OLLAMA_HOST=0.0.0.0 ollama serve。无鉴权,公网暴露高危开放 0.0.0.0 后任何人可调用本地模型。解决方案:公网部署必须加 Nginx 密码或 IP 白名单。端口 11434 冲突其他程序占用端口会启动失败。解决方案:可修改 OLLAMA_HOST=127.0.0.1:11435 更换端口。并发能力弱多程序同时调用会排队阻塞,不适合线上高并发业务场景。无原生图形界面纯命令行/API 工具,可视化需搭配 Dify、Open WebUI 等第三方前端。系统资源占满蓝屏Ollama 默认吃满内存。解决方案:通过环境变量限制内存,后台不要同时开大型软件。模型商用权限区分Ollama 本身免费,但部分模型(如 Llama 系列)有商用限制。提示:Qwen、DeepSeek 可免费商用,使用前请核对模型协议。

商汤大装置图标

商汤大装置

SenseCore 商汤大装置使用指南一、平台介绍商汤自研国产化全栈 AI 智算云平台 SenseCore 2.0。作为国内合规 AI 基础设施,平台提供一站式服务,覆盖算力、数据、模型训练/微调/推理、多模态大模型等全链路能力。业务支持:计算机视觉、LLM、多模态业务。部署模式:提供 SaaS 云服务、私有化部署双模式。硬件适配:原生适配国产 GPU,兼容 OpenAI 接口标准。控制台入口:https://console.sensecore.cn二、核心主要功能弹性算力 ECP支持 A100 国产异构 GPU 集群。具备分钟级启停功能,支持超大模型分布式训练,并行加速比达 96%。数据平台 AIDMP功能涵盖数据集版本管理、分支迭代、标注工具及权限隔离。性能优化:1 个数据包=100 万文件。存储服务提供 AFS 全闪存文件存储、AOSS 对象存储。具备多级缓存机制,加速模型读写。ModelStudio 模型开发支持开源/自有模型托管、微调、批量推理及容器化部署。日日新 SenseNova 大模型支持文生对话、多模态、向量库 RAG 及工具调用 API 服务。配套能力包含云监控 CMS、用户权限 IAM、AKSK 密钥管理、AI 沙盒在线调试。三、适用人群✅ 适合使用AI 企业与研发团队:如计算机视觉、自动驾驶、安防、医疗影像等业务团队。大模型研发/微调团队:高校 AI 实验室、大模型微调项目组。政企项目:需要等保合规的国产化 AI 项目、视觉业务。中小企业:从事图像识别、多模态推理 SaaS 服务的初创或小型公司。❌ 不适合使用个人用户:个人轻度玩 AI、无独立企业资质(无免费算力配额)。普通文案用户:仅需简单对话、无需视觉处理或大规模训练的普通用户。海外业务:国内机房架构,境外访问延迟极高,无海外节点支持。四、免费 & 付费定价官方定价文档统一入口:https://www.sensecore.cn/help/docs 算力计费专题页:https://www.sensecore.cn/help/docs/cloud-foundation/ecp 数据平台计费:https://www.sensecore.cn/help/docs/data-service/aidatahub1. 免费政策无永久免费算力:无免费 GPU 训练资源。试用代金券:新用户享有限时试用代金券(官方不定期发放,需企业实名),用于抵扣算力或存储费用。API 调用:个人账号仅开放日日新基础 API 少量测试调用。AI 沙盒:按量计费,无免费额度。算力规格:试用算力规格受限,不可跑大规模训练。2. 付费模式(1)包年包月企业正式版(数据平台 AIDMP)基础服务费:30,000 元/月 或 300,000 元/年。数据包:125 元/月/包(100 万文件)或 1500 元/年/包,数据集不限量。(2)算力/存储按量/资源包GPU 云主机:支持 4 卡/8 卡 A100 包年包月,批量采购单价更低。AI 沙盒按量:vCPU 0.0061 元/核/分钟、内存 0.00154 元/GiB/分钟。存储:TB 级包年包月资源包,分标准/归档存储。(3)日日新大模型 Token 套餐按 Token 预购充值,多模态、向量模型分开计费。企业大客户可议价。3. 支付与资质实名认证:必须企业实名认证方可采购完整算力;个人仅能调用轻量大模型 API。结算方式:支持对公转账、企业月结。五、快速使用步骤注册与实名:官网注册,完成企业实名(营业执照 + 法人核验),获取租户标识。账号管理:登录控制台 console.sensecore.cn,管理员创建子账号、分配权限。获取密钥:右上角头像生成 AKSK 密钥(API 调用、数据读写必备)。分业务流程操作数据:在 AIDMP 创建数据集、上传图像/文本、标注、管理版本分支。训练:在 ECP 选购 GPU 算力,在 ModelStudio 上传模型/开源权重,启动微调任务。推理:在 AMS 创建推理服务,部署模型生成 API 接口。大模型:通过日日新平台调用对话、文生图、向量检索 API。费用管理:在费用中心查看用量、采购资源包、使用代金券抵扣。六、避坑点【资质门槛坑】 个人账号无法购买 GPU 训练算力,仅企业实名开放;无企业资质无法做模型训练业务。【成本预估坑】 分布式训练、海量图像存储费用高,先试用代金券测算用量,不要直接包年。【密钥安全坑】 AKSK 泄露会被消耗资源,禁止前端硬编码、公开代码上传密钥。【数据计费坑】 数据平台按数据包计费,文件超 100 万需额外购买包,不自动扩容,超限无法上传。【网络地域坑】 机房在国内,海外调用 API 延迟极高;无海外节点。【试用时效坑】 代金券有有效期,过期作废;试用算力规格受限,不可跑大规模训练。【权限协作坑】 数据集/算力需单独分配角色,子账号默认无读写权限,批量协作要提前配置用户组。【接口兼容坑】 日日新兼容 OpenAI 格式,但部分 Function Calling 参数存在差异,对接前需查看官方文档。【退款规则坑】 包年包月资源包购买后不支持中途退款,大客户合同需提前协商解约条款。【备份风险】 存储资源到期不续费会锁定数据,需提前导出模型与数据集。

硅基流动图标

硅基流动

硅基流动(SiliconFlow)指南一、平台介绍硅基流动 是国内领先的国产化开源大模型推理云平台,主要特点包括:自研引擎:搭载 SiliconLLM/OneDiff 加速引擎。接口统一:提供统一 OpenAI 兼容 API,一行代码即可切换模型。一站式托管:支持主流开源 LLM、文生图、多模态模型的托管。灵活算力:提供 Serverless 按量调用、模型微调、专属 GPU 实例及企业私有化部署。访问稳定:国内服务器节点,适配国内开发者及商用开发需求。二、核心功能1. 多模型 API 推理文本类:支持 DeepSeek、Qwen2.5、Llama3、GLM 系列等。视觉类:支持 SDXL、FLUX 等图文/图生图模型。其他能力:代码生成、多模态 OCR 全覆盖。优势:统一兼容 OpenAI 接口,无需修改代码即可切换模型。2. 在线 Playground 体验无需编写代码,直接在网页进行对话。支持生图、调参测试所有模型。3. 模型微调 + 托管支持上传私有数据集微调开源模型。提供一键云端部署推理服务。4. 算力三种模式Serverless 无服务器:按需调用,按量计费。弹性 GPU:应对流量波动,支持自动扩缩容。预留专属 GPU:提供稳定低延迟,适合高并发生产环境。5. 运维管控提供 API 密钥管理。支持用量监控、消费预警。支持 IP 白名单、全链路 HTTPS 加密。6. 配套工具BizyAir ComfyUI 云节点:支持云端本地生图。无需本地显卡:设计师和创作者可直接在云端使用本地模型算力。三、适用人群✅ 适配人群学生/个人开发者:可使用免费 7B 小模型,新用户赠金,适合学习原型开发。独立开发者/小创业团队:低成本接入 DeepSeek 等强推理模型,兼容 OpenAI 接口快速迁移项目。AI 应用厂商:适合搭建 AI 客服、知识库 RAG、内容生成工具。设计师/AI 绘图创作者:支持云端 FLUX/SDXL 批量生图。政企客户:提供私有化部署、等保合规、专属算力服务。❌ 不适合人群纯 C 端对话用户:若无需 API 开发能力,普通对话需求。超大规模训练需求:平台侧重推理,不支持超大规模千亿级自研模型的定制训练。四、免费与付费体系📊 官方定价页面国内中文定价:https://siliconflow.cn/pricing国际英文定价:https://www.siliconflow.com/zh/pricing🎁 免费权益7B 及以下文本模型:永久免费调用,不限额度。新用户赠金:注册即送 14 元体验金(约 2000 万基础 Token),全模型通用。Playground:免费测试,无绑卡门槛。💰 付费模式(按量付费,无月租)文本模型(按百万 Token 计价)轻量开源:0.5 ~ 2 元/百万 Token(INT4 量化版更便宜)。旗舰 DeepSeek-R1/V3:输入低,输出约 16 元/百万 Token(需实名认证 + 最低 50 元充值)。图像生成:512 图约 0.15 元/张,FLUX 高清单价更高。专属 GPU 实例:包月或包时,适合高并发稳定业务。企业定制:支持大额用量阶梯折扣、私有化部署报价。支付渠道:微信、支付宝充值,支持国内本土化支付。五、快速使用步骤1. 注册与认证访问:siliconflow.cn登录:支持手机号、邮箱、GitHub 登录。实名认证:调用收费大模型(如 DeepSeek-R1 等)必须完成实名认证。2. 获取 API Key进入控制台 → API 密钥 → 新建。注意:API Key 仅展示一次,请妥善保存。3. 使用方式方式 1:Playground 在线调试(无需代码,推荐入门)。方式 2:API 调用(兼容 OpenAI SDK)。4. 接口示例基础接口地址:https://api.siliconflow.cn/v1标准请求 JSON:json{ "model": "deepseek-ai/DeepSeek-R1", "messages": [ { "role": "user", "content": "介绍硅基流动平台" } ], "temperature": 0.7 } { "model": "deepseek-ai/DeepSeek-R1", "messages": [ { "role": "user", "content": "介绍硅基流动平台" } ], "temperature": 0.7 } 请求头:textAuthorization: Bearer 你的 API_KEY Authorization: Bearer 你的 API_KEY 5. 进阶操作上传数据集微调模型。购买专属 GPU 实例。六、避坑重点与注意事项⚠️ 1. 免费模型限速风险:7B 免费模型存在 QPS 限制。后果:批量循环调用易触发 429 限流。建议:生产业务必须使用付费大模型或专属实例。🔐 2. 密钥安全风险:前端或公开代码明文存放 API Key。建议:开启 IP 白名单,设置消费预警防止超额扣费。🐌 3. 高峰期延迟风险:Serverless 共享算力在晚高峰存在响应波动。建议:高并发生产场景请选预留 GPU 实例。🔒 4. 实名限制限制:DeepSeek-R1、72B 等高端模型必须实名认证。现状:未实名仅能使用免费小模型。📈 5. Token 双向计费规则:输入 + 输出 Token 均扣费。建议:超长上下文会快速消耗余额,长文本任务需控制 max_tokens。💾 6. 数据留存风险警告:公开 Serverless 环境不适合上传涉密企业数据。建议:涉密场景请选择私有化部署。🧩 7. 接口兼容细节注意:少量小众模型可能不完整支持 Function Calling。建议:选型前先在 Playground 测试功能完整性。⏳ 8. 赠金有效期提醒:新用户 14 元赠金有使用期限。建议:长期闲置会失效,优先用在新项目测试中消耗。