分类导航

发现更多优质 AI 工具

全部 编程代码 创作写作 视频音频 图像视觉 学习辅导 办公效率 设计创意 大模型 提示词 Skills 自动化 知识库 开源&免费 副业
Paperless图标

Paperless

Paperless-ngx 使用指南Paperless-ngx 是一个开源且完全免费的无纸化个人/家庭/小企业文档管理系统(DMS)。它具备强大的功能,能够自动索引、识别、归档纸质或电子文档,将扫描件和 PDF 转换为可快速搜索、分类和检索的数字化档案库。主要功能自动 OCR 识别与索引: 内置Tesseract OCR引擎,上传扫描件或图片后可自动提取文本(支持多语言),生成带有可选择文字的 PDF 文件。智能自动分类(机器学习): 根据历史文档和学习模型,自动为你上传的文档打标签(Tags)、匹配联系人/发行方(Correspondents)和文档类型(Document Types)。全文检索与高级筛选: 支持类似于搜索引擎的全文搜索、自动补全以及按时间、标签、类型、联系人等维度的多条件筛选。自动化抓取 (Consume Folder): 监控指定文件夹或扫描仪共享路径,新放入的 PDF/图片会立刻自动扫描并导入系统。电子邮件集成: 可直接连接你的邮箱(IMAP),自动从指定邮箱中提取发票或附件并导入系统。多用户与权限管理: 支持多账户配置、角色的细粒度权限管控与多租户隔离。适用人群家庭与个人用户: 用于归档家庭发票、医疗单据、合同证书、保修卡、税单等日常纸质文件。小微企业与自由职业者: 替代传统的文件夹归档模式,快速管理业务进销存单据、对账单与客户合同。自建服务(Self-hosted)与隐私敏感爱好者: 拒绝将敏感财务/法律文档上传到第三方云盘,追求数据自主控权的用户。免费与付费情况平台属性: 100% 免费且完全开源(基于GPL-3.0协议)。无论个人或商业使用均无需购买许可证,没有任何功能限制。服务成本: 软件本身没有任何官方付费方案。如果你选择自行部署(Self-Host)(如安装在本地 NAS、旧电脑或家用服务器上),费用为 $0。第三方云部署(可选): 如果你不想自己搭建硬件,可以使用第三方云托管平台(如 Elestio 等云服务商一键托管),此时需付云服务器费用(通常在 $6 - $16/月 左右,由第三方收取而非官方)。项目主页与文档: 可以随时前往 Paperless-ngx 官方 GitHub 仓库 或 官方文档首页 查看最新动态与开发者社区支持。如何使用官方推荐使用 Docker Compose 进行一键部署:环境准备: 准备好已安装Docker和Docker Compose的Linux 服务器、NAS(如群晖、威联通、Unraid)或树莓派。下载示例配置: 官方提供一键脚本或基础配置文件 docker-compose.env 与 docker-compose.yml:bash# 使用官方安装脚本交互式配置 bash -c "$(curl -L https://raw.githubusercontent.com/paperless-ngx/paperless-ngx/main/install-paperless-ngx.sh)" 启动容器:bashdocker compose up -d 访问与配置: 在浏览器中输入 http://<你的 IP>:8000 进入 Web UI,使用部署过程中创建的管理员账号登录即可开始使用。注意事项磁盘空间与性能消耗: OCR 解析(尤其处理数百页大文件或高分辨率图片时)需要消耗一定的CPU和内存算力。如在低配设备(如老旧树莓派)上运行,建议限制并发 OCR 任务数。原始文件安全与备份: Paperless-ngx 默认会保留原始文件(Originals)和处理后的文件(Archive)。请务必定期备份其存储目录(Data & Media 目录)和PostgreSQL 数据库。扫描文件命名规范: 如果配合物理扫描仪使用,建议将扫描件输出格式设为PDF或高清晰度PNG/TIFF,这会显著提高OCR 识别的准确率。

Recordly图标

Recordly

Recordly:开源屏幕录制与剪辑工具官方网站:recordly.devRecordly 是一个开源、跨平台(支持 Mac/Windows/Linux)的桌面级屏幕录制与演示视频剪辑工具。其被定位为 Screen Studio 的开源免费替代品。该工具旨在解决“录屏后再找专业剪辑师添加放缩、画中画、游标平滑与背景边框”的痛点,帮助用户在极短时间内直接生成高质量的产品 Demo、操作教程和宣传短视频。1. 主要功能自动/手动镜头放大:根据鼠标点击与轨迹自动捕捉焦点并平滑放大,也支持在时间轴上手动添加放大区域。光标美化与动态平滑:自动隐藏/替换原始鼠标指针,提供轨迹平滑、运动模糊、点击波纹(Click Bounce)、摆动及 macOS 风格游标样式。摄像头动态画中画:支持插入摄像头浮窗,可自定义形状、阴影、镜像及比例,且摄像头能随画面放缩自动动态调整比例。专业背景与外框样式:支持为录屏画面添加渐变背景、预设/自定义壁纸、背景高斯模糊、圆角、内边距与阴影效果。时间轴剪辑与标注:支持在时间轴上裁切片段、调节局部播放速度(变速)、叠加文本/图片/形状标注、添加额外音频轨等。多格式导出与项目保存:支持导出为高清 MP4 或 GIF 动图(可设循环、帧率);工程可保存为 .recordly 文件以便后续修改。扩展与组件插件:提供 Marketplace 插件市场,可加载社区开发的点击音效、浏览器外框 mockup、壁纸等。2. 适用人群产品经理与开发者:快速录制产品 Demo、功能更新演示视频或提交 Bug 演示。独立开发者与创作者:为 App、SaaS 工具制作吸引眼球的宣传短片和社交媒体展示 GIF,无需掌握复杂剪辑软件(如 PR、AE)。技术文档与教程作者:录制高清晰度、重点突出的操作指南与步骤说明。3. 免费与付费情况许可与价格:100% 免费且完全开源(基于 AGPL-3.0 协议)。所有本地功能均可无限制免费使用。官方资源与更新:官方项目不包含任何商业付费版本。如需随时了解项目更新或赞助作者,可直接前往:https://github.com/webadderallorg/Recordly 或其官网查看最新动态。4. 如何使用安装下载:直接前往 GitHub 的 Releases 页面下载适合您系统(macOS、Windows、Linux)的安装包;Arch Linux 用户可通过 AUR 安装 yay -S recordly-bin。录制步骤:打开应用 ➔ 选择需要录制的屏幕或应用窗口 ➔ 开启/关闭系统声音与麦克风 ➔ 点击录制 ➔ 停止录制后直接进入编辑界面。编辑与导出:在编辑界面调节自动放缩强度、美化鼠标样式、调整背景外框 ➔ 满意后点击导出为 MP4 或 GIF 格式。5. 注意事项macOS 系统要求:需 macOS 14.0 (Sonoma) 及以上版本,以利用 native ScreenCaptureKit 实现完美的系统声音捕获与原生鼠标隐藏。Windows 系统要求:建议 Windows 10 Build 19041 (20H1) 及以上版本。旧版本由于降级到 Electron 捕获 API,录屏中可能会残留系统的真实鼠标指针。Linux 系统要求:目前由于 Electron 限制,暂不支持原生隐藏鼠标指针(若同时开启软件自带的光标美化,可能出现“双鼠标”现象);系统声音捕获通常依赖 PipeWire。Mac 本地构建提示:如果自行拉取源码打包,在 macOS 上首次打开可能会被系统隔离提示打不开,需在终端运行 xattr -rd com.apple.quarantine /Applications/Recordly.app 清除隔离标记。

LocalSend图标

LocalSend

LocalSend 平台使用指南1. 平台概述LocalSend是一款完全免费、开源的局域网文件传输工具,被广泛视为 AirDrop(苹果随手传)的跨平台替代方案。数据传输完全基于局域网(LAN),不经过任何第三方服务器。这意味着既不消耗互联网流量,又能有效保障数据隐私与安全。2. 主要功能跨平台互传: 支持 Windows、macOS、Linux、Android、iOS / iPadOS 等多系统间的文件交互。零配置自动发现: 只要设备连接到同一个 Wi-Fi 或局域网,打开软件即可自动识别邻近设备,无需复杂设置。多样化传输形式: 支持发送文件、文件夹、剪贴板文本以及直接发送文字消息。免安装 Web 接收(Web Share): 支持开启临时 HTTP 网页服务,未安装软件的设备(如访客手机)只需扫描二维码或输入局域网 IP即可通过浏览器下载文件。安全加密: 传输过程采用端到端 TLS/HTTPS 加密,防止局域网内数据被监听。3. 适用人群多设备/跨系统用户: 适合同时使用 Windows 电脑与 iPhone,或者 Android 手机与 Mac 等不同设备混合使用的场景。高隐私/办公敏感人群: 适合不希望将商业机密、私密照片或大文件上传到云盘或微信服务器传输的用户,强调数据本地化。大文件传输需求者: 适合传输动辄几 GB 的视频文件的用户,无需等待云端上传和下载,可直接跑满局域网最高网速。4. 免费与付费情况许可与价格: 项目为 100% 免费且开源(开源协议为 MIT),无广告、无功能限制、无传输文件大小或速度限制。无付费订阅方案: 官方不存在任何收费功能或付费套餐,应用商店中的自选内购仅为志愿捐赠/赞助支持。项目动态与赞助: 如需了解项目进展或赞助开发者,可直接查看:https://github.com/localsend/localsend。5. 如何使用安装软件: 在需要互传文件的所有设备上安装 LocalSend,可通过官网下载对应系统的安装包或应用商店下载。连接同一网络: 确保所有设备连接在同一个 Wi-Fi或同一路由器局域网下。发送文件:打开软件,进入 “发送” 选项卡。选择要发送的文件、文本或文件夹。在下方候选列表中点击目标设备名称(如 Cool Avocado),目标设备弹框确认后即可开始传输。6. 注意事项局域网隔离与防火墙:防火墙拦截: 首次在 Windows/Mac 上运行时,若弹出系统防火墙提示,请务必勾选允许局域网通信。AP 隔离(Guest Wi-Fi): 如果连接的是公共 Wi-Fi、酒店 Wi-Fi 或开启了“AP 隔离/访客网络”的路由器,设备之间无法互相搜索。此时可尝试用一台手机开启热点,其他设备连接该热点来传输。别名识别: LocalSend 默认会自动生成一个随机有趣的动物名(如 Quick Orange)作为设备别名,建议在“设置”中将其修改为易于识别的名称(如 John-MacBook)。静默接收与自动保存: 频繁互传时,可在“设置”中开启“快速保存”或将特定信任设备加入白名单,跳过每次手动点击“同意”的步骤。

ReClip图标

ReClip

ReClip 开源项目一、平台介绍定位:一个轻量级、可自托管(Self-hosted)的在线音视频下载器,自带简洁明了的 Web 前端界面。技术底座:底层依赖强大的开源命令行工具 yt-dlp 和 ffmpeg,后端采用 Python (Flask) 构建,极度精简(后端源码仅约 150 行)。二、主要功能海量平台支持:支持下载 YouTube、TikTok、Instagram、Twitter/X、Reddit、Facebook、Bilibili、Vimeo、Twitch 等 1000+ 网站的音视频。双模式导出:支持导出为 MP4(视频)或 MP3(提取纯音频)。分辨率/画质选择:解析链接后可自由挑选不同的清晰度与音视频质量。批量下载:支持一次性粘贴多个 URL 进行批量解析与下载。智能去重:自动识别并过滤重复粘贴的链接。三、适用人群开发者 / 自建服务爱好者:希望在 NAS、服务器或个人电脑上搭建私人下载站的用户。内容创作者 / 离线影音用户:需要经常跨平台(如 TikTok、YouTube、X)下载素材或存档视频的人群。追求极简与隐私的用户:厌烦了第三方下载网站的弹窗广告、限制及隐私泄露风险,希望拥有完全自主可控工具的人。四、免费 / 付费情况完全免费且开源:ReClip 遵循 MIT 许可证,100% 免费开源,无付费版本,无订阅费,无内置广告。定价页面说明:项目无任何收费计划,因此不存在官方付费/定价页面网址。五、如何使用(快速上手指南)方式 1:Docker 一键运行(推荐)前置条件:如果你安装了 Docker。终端执行命令:直接在终端执行以下命令构建并启动容器:bashdocker build -t reclip . && docker run -p 8899:8899 reclip 访问 Web 界面:运行后在浏览器访问 http://localhost:8899。方式 2:本地直接部署安装依赖(前提条件):macOS 系统:执行 brew install yt-dlp ffmpeg。Linux/Windows 系统:确保安装了 ffmpeg 和 Python 环境。克隆仓库并运行:bashgit clone https://github.com/averygan/reclip.git cd reclip ./reclip.sh 打开 Web 界面:浏览器访问 http://localhost:8899。界面操作流程粘贴一个或多个视频链接到文本框。选择输出格式(MP4 视频或 MP3 音频)。点击 Fetch 按钮提取视频信息和缩略图。选择所需画质,点击单个 Download 或 Download All 导出文件。六、注意事项环境依赖:项目本质上是 yt-dlp 的 Web GUI 包裹层,如果解析失败,通常需要及时更新本地/容器内的 yt-dlp 版本(因为目标网站接口变动频繁)。网络环境:下载特定海外平台(如 YouTube、Twitter)视频时,部署 ReClip 的服务器/设备需要具备访问相应网站的网络权限。版权合规:仅供个人学习与离线备份使用,请遵守目标平台的协议及版权法律法规。

Obscura图标

Obscura

obscura.sh1. 平台介绍定位与架构:基于 Rust 开发的轻量无头浏览器服务,面向 AI Agent、网页数据抓取场景。提供开源本地引擎与 Obscura Cloud托管云服务两种模式。核心特性:兼容 Chrome DevTools Protocol (CDP),可替换 Headless Chrome。会话启动速度<50ms,内存占用远低于原版 Chrome,每个会话完全隔离且无状态污染。2. 主要功能浏览器会话管理:支持页面访问、JS执行、点击交互、表单输入及数据提取。输出与伪装:提供图片截图、PDF文档生成及页面录屏;内置反检测stealth指纹伪装能力。协议兼容性:完全兼容 CDP 协议,原有 Playwright/Puppeteer代码仅需少量修改即可迁移适配。部署灵活性:支持两种模式——Docker自托管开源版与Cloud托管 API 服务,后者支持大规模并发会话。安全隔离:实现会话沙盒隔离,无 cookie/cache互相污染,确保任务可复现。3. 适用人群开发者群体:适用于 AI Agent开发、大规模网页爬虫、自动化测试等场景。技术团队:适合需要大量并发浏览器实例、希望降低 Chrome资源开销的团队。不适用场景:不适合普通用户日常网页浏览;不适用于复杂重度网页渲染、多媒体交互场景。4. 免费付费情况开源引擎模式:采用 Apache‑2.0许可证,可本地Docker部署,所有功能完全免费且无阉割。Obscura Cloud服务:提供托管 API 实例。无公开网页定价页面,需联系销售询价获取报价;仅支持境外支付。付费增值服务:包括托管云实例、住宅代理资源及技术支持(Cloud版配置)。5. 如何使用方式一:本地自托管(开源)通过Docker拉取镜像部署Obscura服务。项目直接复用 Playwright/Puppeteer库,仅修改CDP连接地址指向本地Obscura实例。执行自动化抓取、Agent网页访问任务。方式二:Obscura Cloud托管 API访问官网注册账号获取API Key。通过API快速创建隔离浏览器会话。使用 CDP/Playwright对接,完成页面操作,任务结束后自动销毁会话。支持横向扩容至上千并发会话。6. 注意事项网络稳定性:国内直连Cloud服务网络容易不稳定或超时;建议本地自托管以避免此问题。代理配置:开源版无内置代理,反爬需自行配置代理池;Cloud版代理属于付费增值项。渲染能力:虽然兼容 CDP,但部分重度网页、复杂WebGL页面的渲染能力弱于原版 Chrome。商业合规:Cloud无自助公开定价,商用前必须联系销售确认配额与SLA。法律风险:网页抓取需遵守目标网站的 robots 协议,规避相关法律风险。维护责任:开源版无官方 SLA,生产环境需自行维护监控体系。产品定位:非普通可视化浏览器,无 GUI界面,全部通过代码/API调用。

WhisperSubTranslate图标

WhisperSubTranslate

WhisperSubTranslate 实用指南一、平台介绍类型:本地桌面工具(Windows)技术架构:基于 Whisper.cpp(语音识别) + 翻译模型核心特点:100% 本地运行(可离线),无需联网即可使用无需账号 / 无需上传视频,隐私安全有保障开源(GPL-3.0),源代码公开核心定位:实现 “视频 → 自动字幕(SRT)→ 多语言翻译” 的一体化工具二、主要功能字幕生成(核心功能)从视频音频中识别字幕(Speech-to-Text)支持 100+ 种语言 的语音识别字幕翻译离线翻译:内置 Hy-MT2 模型,无需网络在线翻译:可接入以下服务配置 APIMyMemory(免费)DeepLOpenAIGemini本地化优势视频文件不上传云端,数据不出本地支持完全离线处理流程所有处理数据均保存在本地实用功能扩展自动模型下载(无需手动配置环境)队列处理(支持批量任务)字幕时间轴修复(针对长视频同步优化)GPU / CPU 性能自动适配三、适用人群适合以下用户使用:🎬 视频创作者(如 YouTube / B站 UP 主)🎓 外语学习者(用于观看外语课程或教材)🎧 字幕翻译人员(用于本地化工作)🧑‍💻 技术用户(希望避免折腾 Python 或命令行)🔐 注重隐私者(不希望上传视频至第三方服务器)👉 特别推荐场景:长视频(如课程、访谈、会议录音)的字幕制作与多语言处理。四、免费 / 付费情况软件本身费用完全免费 + 开源无订阅制、无需注册账号可能产生的额外费用(可选)若选择使用“在线翻译 API",需自行承担对应服务商的费用:MyMemory:免费使用,但有调用次数限制DeepL:提供少量免费额度,超出后按量收费OpenAI:付费模式,按 Token 数量计费Gemini:提供免费或低价额度(推荐低成本方案)定价参考说明翻译 API 需自行申请 Key 并遵循其官方定价五、如何使用下载与安装进入项目 Releases 页面下载 ZIP 压缩包解压后直接运行 .exe 程序即可启动生成字幕将视频文件拖入软件界面选择识别模型(推荐 large-v3-turbo)点击开始,自动生成 .srt 格式字幕翻译字幕(可选)选择翻译模式:本地模型(离线)或配置 API(在线高质量)导出文件输出标准的 SRT 格式字幕字幕可直接用于 VLC、各类剪辑软件等播放器六、注意事项功能边界限制❌ 不支持提取视频中已有的字幕轨道❌ 不支持识别画面中的文字(无 OCR 功能)硬件性能要求大模型需要一定的内存与显存(建议 2GB~8GB+)若无 GPU 也能运行,但速度会相对较慢翻译限制说明免费 API 存在调用额度上限处理长视频时建议优先选择 Gemini / DeepL 或本地模型长视频同步问题可能出现的字幕漂移现象解决方案:使用 Sync 模型 进行时间轴修复七、一句话总结本地 AI 字幕工具(识别 + 翻译) 免费、离线、无上传风险,非常适合长视频字幕制作与多语言处理。

DBX图标

DBX

DBX 平台使用指南一、平台介绍DBX 是一个开源数据库工作台(Database Workspace),把数据库日常操作(连接、SQL、数据查看、结构分析、AI 辅助等)整合到一个工具里。核心特点:一个工具管理 70+ 数据库支持桌面版 + Docker 自托管 Web 版内置 AI 助手强调“轻量 + 高效工作流”完全开源免费二、主要功能1. 数据库连接支持多种类型:MySQL / PostgreSQL / Redis / MongoDB / Oracle 等支持 SSH 隧道、代理连接,解决内网访问问题2. SQL 编辑器提供自动补全、语法高亮、格式化功能记录查询历史,方便回溯支持选中执行 SQL 脚本3. 数据管理(类似 Excel)表格查看、筛选、排序行内编辑 + SQL 预览支持数据导入/导出4. 数据库结构分析Schema 浏览生成 ER 图字段血缘分析Schema 对比(环境差异)5. 数据迁移与同步数据导入/导出SQL 文件执行跨数据库传输6. AI 助手自然语言生成 SQL查询解释与优化错误修复建议7. 自托管访问Docker 部署浏览器访问(适合团队共享)三、适用人群适合以下用户:开发者 / 后端工程师日常写 SQL、查数据、调试数据库数据分析师快速查询、导出数据、做分析运维 / DBA管理多数据库环境做结构对比、数据迁移团队协作用 Docker 部署统一数据库入口四、免费 / 付费情况✅ 完全开源(免费)❌ 官网暂无商业付费版本或定价页面AI 功能需要自行提供 API Key(如 OpenAI)产生费用来自第三方接口,官方不直接收费五、如何使用(快速上手)参考官方指南:https://dbxio.com步骤(简版):安装:下载桌面版 / 或 Docker 部署新建连接:选择数据库类型,填写 host / 用户名 / 密码测试连接:成功后保存配置开始使用:写 SQL、查看数据、分析结构六、使用注意事项生产环境谨慎操作:所有修改操作建议先查看 SQL 再执行,防止误操作AI 生成 SQL 不会自动执行:必须人工确认(防误删数据)连接安全:密码单独加密存储,支持 SSH 隧道访问内网数据库环境区分:建议用颜色区分:开发 / 测试 / 生产环境版本适用性:桌面版适合个人使用;Web 版适合团队共享七、一句话总结👉 DBX = 轻量级 + 多数据库 + AI 辅助的一体化数据库管理工具(开源免费版 DataGrip 替代)

LuxTTS图标

LuxTTS

LuxTTS 完整指南一、平台介绍LuxTTS 是一个开源的文本转语音(TTS)+ 声音克隆模型,主要特点如下:极快速度:推理速度约为 150 倍实时。高质量语音:输出采样率为 48kHz(高于常见的 24kHz)。轻量可本地部署:仅需约 1GB 显存 即可运行。👉 本质定位: 这是一个“可本地运行的高质量语音克隆引擎”,非常适合用来替代传统的云 TTS 服务。二、主要功能1. 声音克隆(核心卖点)零样本克隆:无需训练即可实现。同音色生成:使用一段参考音频 → 直接生成同音色的语音。2. 高质量语音输出高音质:支持 48kHz 采样率,远超行业平均水平。自然语调:拥有更自然的韵律(Prosody)。3. 超高速推理GPU 加速:最高可达 150x realtime。CPU 可用:支持在 CPU 环境下实时生成(适合弱算力设备)。4. 风格控制(进阶)多参数控制:可精细控制语速、情绪、音量。采样调优:支持调整 sampling 相关参数以获得最佳效果。5. 轻量 & 可部署显存低:仅需约 1GB 显存。多环境支持:兼容本地环境、Colab 云端以及 HuggingFace Spaces。三、适用人群该项目明确适合以下三类用户群体:技术类开发者AI 开发者(构建语音系统 / 数字人)。后端工程师(开发语音 API 接口)。开源玩家或希望自部署的用户。内容创作者视频配音(如 YouTube、抖音)。播客制作或有声书录制。AI 虚拟人构建。企业应用场景呼叫中心(客服语音)。教育与无障碍语音辅助。游戏内的动态语音生成。四、免费 / 付费情况✅ 开源政策(当前)License:采用 Apache-2.0 协议。商用权限:允许商用(需遵守相应协议)。🚫 付费服务说明无官方 SaaS 定价:不存在官方收费套餐。无官方 API 计费:没有官方的 API 调用计费页面。👉 关于“付费”: 通常涉及成本的方式是使用第三方部署平台(如 fal.ai)或支付云 GPU 运行成本。五、如何使用1. 安装依赖bashgit clone https://github.com/ysharma3501/LuxTTS.git cd LuxTTS pip install -r requirements.txt 2. 加载模型pythonfrom zipvoice.luxvoice import LuxTTS lux_tts = LuxTTS('YatharthS/LuxTTS', device='cuda') 3. 准备参考声音(关键步骤)输入文件:例如 audio.wav。编码处理:执行以下代码进行编码。pythonprompt_audio = "audio.wav" encoded = lux_tts.encode_prompt(prompt_audio) 4. 生成语音文本输入:如 "你好,这是一个测试"。执行生成:调用 generate_speech 函数。pythontext = "你好,这是一个测试" wav = lux_tts.generate_speech(text, encoded) 5. 保存音频文件使用 soundfile 库将生成的波形数据保存为文件。pythonimport soundfile as sf sf.write("output.wav", wav.numpy(), 48000) 👉 一句话总结流程: 文本 + 参考声音 → 输出克隆语音六、进阶参数在使用模型时,可通过以下参数进行调优:num_steps作用:数值越大音质越好,但速度越慢。推荐值:3~4 为性价比最高区间。t_shift作用:用于在发音准确性和整体音质之间进行权衡。speed作用:控制生成语音的语速快慢。rms作用:控制输出音频的整体音量。return_smooth作用:启用或关闭降噪/平滑处理功能。七、注意事项参考音频质量决定上限时长建议至少 3 秒以上。音频需清晰,避免背景噪音过大。首次运行慢(正常现象)加载 librosa 库初始化约需 10 秒,属正常等待时间。多语言支持不稳定Issue 中反馈存在混合语言问题。部分发音异常情况可能出现在非英语或中文混合场景。常见问题与解决出现杂音或截断:尝试调低 t_shift 值或增加 num_steps。声音不像原音:建议更换更高质量的参考音频片段。硬件建议GPU 推荐:≥ 8GB 显存运行更稳定。CPU 模式:可用但生成性能有限,适合轻量任务。八、优缺点总结👍 优点列表开源可商用:协议宽松,商业风险低。极快推理速度:在同类模型中表现行业领先。资源占用轻量:本地可跑,适合个人或小团队。声音克隆能力强:零样本效果优秀。👎 缺点列表无官方 UI:需要自行开发前端界面或集成。多语言支持待完善:中文及部分小语种仍在优化中。技术门槛要求:需要一定的 Python/深度学习背景。

RVC图标

RVC

RVC1. 平台介绍Retrieval-based Voice Conversion WebUI (RVC) 是一个开源的 V2V(Voice-to-Voice,语音到语音) 声音变换与克隆框架。它基于 VITS 架构 与 基于特征检索(Retrieval-based) 的技术改进,核心能力在于能够把源音频的音色替换为目标 Speaker 的音色,同时保留原语音的 语调、情感和节奏。2. 主要功能推理转换(AI 翻唱 / 变声):支持上传干声/语音并选择模型以生成目标音色的音频。用户可调整 变调(Pitch)、变音算法(如 RMVPE, PM, Harvest, Crepe)及音色融合度。模型训练(声音克隆):仅需 10~20 分钟 干净的目标语音干声即可训练出专属音色模型。实时变声(GUI):配合虚拟音频线(如 VB-Cable)与低延迟驱动(ASIO),可在 Discord、游戏、直播等场景中实现低延迟实时变声。辅助工具:人声伴奏分离:内置人声与伴奏切分工具。模型融合(Ckpt Merge):可将多个音色权重进行比例叠加,混合出新的音色。3. 适用人群VTuber / 游戏主播 / 内容创作者:用于实时变声或制作角色语音包。AI 音乐爱好者:用于制作 AI 歌手翻唱(AI Cover)。配音员 / 音频工程师:用于修正人声音效或做音色替换。4. 免费/付费情况完全免费与开源:项目基于 MIT 许可证 开源,费用为 100% 免费,支持离线部署运行。源码与更新地址:项目托管于 GitHub - RVC-Project/Retrieval-based-Voice-Conversion-WebUI。5. 如何使用(快速上手指南)硬件与环境准备操作系统:支持 Windows / Linux / macOS。硬件建议:推荐使用 NVIDIA 显卡(建议 6GB 及以上显存;纯 CPU 可运行但推理/训练极其缓慢)。下载与启动从 GitHub Release 页面下载整合包(预安装环境与依赖)。解压后点击 go-webui.bat 启动 WebUI 界面,默认会自动打开浏览器访问 http://127.0.0.1:7865。(如需实时变声)运行 go-realtime_gui.bat。音色推理(转换声音)切换到 “模型推理” 选项卡。将训练好的 .pth 模型文件放入 assets/weights/ 目录,将对应 .index 文件放入 assets/indices/。点击“刷新音色列表”,选择目标模型。上传需要转换的音频文件。调节关键参数:变调(Pitch/Key):男声变女声通常设置为 +12,女声变男声 -12;若是同性别翻唱保持 0。音高提取算法:优先推荐 RMVPE(效果最好且速度快、不哑音)。检索特征占比:建议保持 0.6 - 0.75,防止漏音。点击 “转换” 并导出音频。模型训练(自制音色)切换到 “训练” 选项卡。步骤 1:输入实验名称,选择采样率(推荐 40k/48k)与是否包含音高 F0。步骤 2a:指定训练干声文件夹路径,点击“处理数据”。步骤 2b:选择 RMVPE 算法提取特征和音高。步骤 3:设置总训练轮数(Epoch,建议 100~300),点击“训练模型”与“训练特征索引”。6. 注意事项数据质量决定一切:训练素材务必使用无噪音、无伴奏、无重度混响的 干净干声。有杂音的数据会导致输出有电音或破音。版权与肖像权安全:切勿将未经授权的他人音色模型用于公开发布、商业用途或欺诈行为。算法选择:推理和提取音高时优先使用 RMVPE。以前常用的 Harvest 耗时极长,PM 容易变哑音。路径不能包含中文:存放 RVC 项目文件及音频数据集的目录路径中 严禁包含中文或特殊字符,否则容易引发 PyTorch 加载报错。

Xagent图标

Xagent

XAgent 平台使用指南一、平台介绍核心理念:倡导“描述结果,而非工作流(Describe tasks. Not workflows.)”。差异化特点:区别于 Dify / Coze 等依赖硬编码拖拽式 Flowchart(工作流)的平台,Xagent 强调自主规划(Dynamic Planning)与工具调度。用户只需输入最终目标,平台即可自动进行任务分解、工具调用、自我评估与迭代交付。核心定义:由 Xorbits 团队开源的面向个人、团队与企业的动态任务执行引擎与 AI Agent 协作平台。二、主要功能动态任务规划 (Dynamic Planning)根据目标在运行时(Runtime)自动拆解多步骤子任务。支持自动反射机制,遵循“计划→执行→反思”的流程逻辑。支持条件分支执行,适应复杂场景。工具与能力集成 (Tools & Knowledge Integration)模型支持:原生对接 OpenAI、Claude、DeepSeek、通义千问、Zhipu 等主流 API。私有化部署:无缝集成自建的 Xinference 本地/私有化模型。知识库与扩展:内置 RAG 知识库检索,支持文件读写分析及分析能力。插件规范:支持 MCP (Model Context Protocol) 插件规范及自定义 API 扩展。多 Agent 协作工作流 (Workforces Pattern)支持构建复杂的分布式 Agent 团队(如:规划者 + 调研员 + 程序员 + 审核员)。实现多角色协同分工,处理复杂业务逻辑。可复用 Agent 模版可将探索成功的单次任务模式(提示词、特定工具链、知识库权限)打包发布为模版。供团队内复用,降低重复开发成本。全流程可观测性 (Observability)实时跟踪 Agent 执行状态。提供思考日志、工具调用详情及 Token 消耗统计视图。三、适用人群个人开发者 / AI 玩家:需要比纯 Chat 界面更强的本地自动化 Agent 工具,适用于长文本处理、复杂数据分析及自主调研场景。团队 / 研发小组:需要将日常重复的业务逻辑打包成固定的 Agent 工具链,从而提升协作效率。企业级开发者:基于私有模型(如通过 Xinference 部署)搭建企业内部知识库、合规工具链与多 Agent 业务系统的专业团队。四、免费与付费情况开源状态:Xagent 核心代码完全开源,基于标准开源协议开放,个人与企业均可免费自建部署。社区自建版:免费。支持使用全量功能,仅需自行承担模型 API 消耗或本地显卡算力费用。商业服务与定价:关于 SaaS 云服务、企业级 SSO 或专属服务支持的最新动态。建议随时查看官方定价页面([https://docs.xagent.co/](https://docs.xagent.co/))获取最新信息。五、如何使用方式 1:单机快速安装(推荐体验)确保环境满足 Python 3.11+ 要求。执行安装命令:pip install xagent-ai (或使用 uv tool install xagent-ai)。启动服务:运行 xagent 命令。浏览器访问 http://127.0.0.1:8000。在 /setup 页面创建管理员账号,并配置 LLM Provider 即可开始使用。方式 2:Docker 容器化部署(适合团队/服务器部署)克隆仓库并配置环境变量: 运行 git clone https://github.com/xorbitsai/xagent.git 后进入目录 cd xagent。复制示例环境文件:执行 cp example.env .env。一键启动 Docker 服务:运行 docker compose up -d。浏览器访问 http://localhost:80 进入 Web UI 管理界面。六、注意事项模型能力要求:由于采用动态规划(Dynamic Task Planning)模式,Agent 的逻辑推理与工具调用非常依赖底层 LLM 的质量。建议优先选用 Reasoning 能力强或 Tool Call 效果好的模型(如 Claude 3.5 Sonnet、GPT-4o、DeepSeek-V3/R1)。死循环与 API 消耗:Dynamic Engine 在无法完成任务时可能会自主尝试多次重试。建议在后台系统设置中配置单次任务的最大步数(Max Steps)与 Token 阈值,避免无限循环导致 API 账单超支。环境隔离与安全:若允许 Agent 执行 Code/Bash 工具,请确保运行在 Docker 或隔离的虚拟环境中,避免对宿主机敏感数据产生潜在风险。

Google Code Wiki图标

Google Code Wiki

Google Code Wiki 平台指南一、平台介绍与定位核心定义: Google Code Wiki (codewiki.google) 是谷歌推出的 AI 驱动代码文档生成 与 代码库理解 专用平台。核心价值: 解决了 “代码阅读”作为开发效率最大瓶颈 的问题,旨在替代传统静态/易过期的 README 文件。主要产出: 为整个 GitHub 仓库自动生成并维护动态的、结构化的文档系统。二、核心功能特性自动化动态文档:自动解析代码库的架构、模块、API 和类定义;当发生 Commit/PR 合并 等更新时,文档会自动重新生成并保持实时同步;智能超链接跳转:文档中出现的任何概念、函数或类的描述均直接附带原代码文件与具体行数的跳转链接;架构图表自动生成:自动绘制架构图(Architecture Diagram)、序列图(Sequence Diagram)及类图,图表会随代码更新自动重绘;Gemini 驱动的代码对话:基于当前仓库的全量文档作为知识库提供实时 AI Q&A;回答中准确附带关键位置的 代码行级引用;AI 音视频概览:结合类似 NotebookLM 的技术,自动生成代码库的高级结构与架构流转的音视频导读。三、适用人群与场景开源项目贡献者 / 新入职员工: 快速理解陌生代码库,将 Onboarding(入职引导)成本降至最低;资深开发者 / 系统架构师: 在几分钟内理清大型或复杂项目的模块划分与底层技术架构;代码审查者 (Reviewer) / 维护者: 快速核对 PR 修改的影响范围,免除手动维护文档的繁重负担。四、免费与付费现状当前服务状态:**完全免费(Public Preview)**阶段;公共仓库开放使用,支持直接查询或提交 GitHub 公开仓库进行索引生成;私有/企业级支持计划:Google 正在开发 Gemini CLI extension,用于在本地/企业私有环境运行 Code Wiki;目前私有库功能处于 Waitlist 申请阶段;官方入口及定价页面链接:平台主页:codewiki.google;官方更新与公告页面:Google Developers Blog。五、使用指南直接网址拼接(最快捷):在浏览器地址栏输入格式为 codewiki.google/github.com/<owner>/<repo>;例如查询 React 仓库可输入:codewiki.google/github.com/facebook/react;搜索栏查询模式:访问 codewiki.google,直接在输入框粘贴公开 GitHub 仓库链接或搜索项目名称即可生成文档;互动与提问操作:生成文档后,使用右侧/下方的 Gemini 提问框(如询问“解释这个项目的鉴权流程”、“数据库模块由哪些文件处理”);点击生成的超链接即可查看对应的源码。六、注意事项与风险提示私有仓库支持限制:Web 版目前仅支持 GitHub 公开仓库 (Public),暂不支持直接挂载私有库查询,需等待 Gemini CLI extension 发布以解决本地/企业环境需求;AI 幻觉风险验证:文档基于结构化代码解析生成,复杂逻辑可能存在推断偏差,务必点击文档中的超链接核对关键业务逻辑与实现细节;超大仓库索引延迟:对于极其庞大的 Monorepo(单体仓库),首次生成或重新索引可能需要一定处理时间请耐心等待。

Spec Kit图标

Spec Kit

GitHub Spec-Kit 使用指南一、平台介绍核心理念 *将开发模式从“先写代码再补文档”翻转为“规范即执行”。*通过逐步生成可评审的文档(宪法、需求规范、技术方案、任务清单),为 AI Agent 提供稳定的契约。项目性质 开源工具包,包含 specify CLI 命令行工具 + Agent Prompt 模板 + 脚本库。开源协议 MIT License(完全开源)。二、主要功能项目脚手架(Specify CLI) 一键生成规范驱动开发所需的目录结构、提示词及配置文件。阶段化斜杠指令(Slash Commands)/speckit.constitution:定义项目的全局不可违背准则,包括代码规范、架构约束、测试要求等。/speckit.specify:专注于“业务要做什么(What/Why)”,生成高层需求规范 spec.md,不掺杂技术细节。/speckit.clarify:主动提问以检查需求中的二义性、模糊点及边缘场景并补充完善。/speckit.plan:专注于“技术怎么做(How)”,制定技术选型、数据模型与架构方案 plan.md。/speckit.tasks:将方案拆解为带依赖关系、可并行执行的确定性任务清单 tasks.md。/speckit.analyze:交叉检查 Consistency,确保规范、方案、任务之间的一致性。/speckit.implement:驱动 Agent 按任务列表分步、小步快跑地编写代码。广泛的 Agent 生态集成 支持 GitHub Copilot、Claude Code、Cursor、Gemini CLI、Windsurf 等 30+ 款主流 AI 编码 Agent。三、适用人群AI 辅助开发者 / 独立开发者:希望用 AI 写大中型项目,但不想让 AI 乱改代码或迷失方向。软件架构师 / 技术 Leader:需要制定代码约束与架构规范(Constitution),控制 AI 输出质量。研发团队 / Product Manager:希望在写代码前快速评审需求规格 spec.md,确保产品与工程对齐。四、免费与付费情况Spec-Kit 本身费用:完全免费且开源。没有官方的付费商业版或订阅模式。第三方成本说明:使用 Spec-Kit 需要配合 AI Coding Agent 或 LLM API(如 GitHub Copilot 订阅、Claude API、OpenAI API 等),这部分按对应厂商的定价付费。相关网址链接:Spec-Kit 官方 GitHub 仓库:github.com/github/spec-kitGitHub Copilot 定价页面(若搭配 Copilot 使用):github.com/pricing五、如何使用(标准工作流)安装 CLI需要先安装 Python 的极速包管理器 uv。随后在项目根目录运行以下命令以集成 Copilot 或 Cursor:bash# 通过 uv 安装 specify-cli uv tool install specify-cli --from git+https://github.com/github/spec-kit.git # 初始化项目并指定集成方式(此处示例为 copilot) specify init my-project --integration copilot cd my-project 执行标准七步法在 Agent Chat 中按顺序使用斜杠指令:/speckit.constitution:生成 constitution.md,录入项目不可逾越的规则。/speckit.specify <需求描述>:用自然语言描述需求,生成 spec.md(What/Why)。/speckit.clarify:让 AI 审查 spec.md,回答其提出的补全问题并完善细节。/speckit.plan:给出技术偏好(如“使用 Go + PostgreSQL"),生成 plan.md(How)。/speckit.tasks:生成分步骤的任务列表 tasks.md。/speckit.analyze:运行一致性检查,确保任务和方案无冲突。/speckit.implement:让 AI 逐条完成 tasks.md 中的编码任务。六、注意事项严禁越级编码 在没有审核通过 spec.md 和 plan.md 之前,不要直接跳到 /speckit.implement 进行生成代码操作。任务颗粒度控制 如果 tasks.md 中某个任务过于庞大,应当让 Agent 继续拆细,否则 AI 容易在单次生成中产生遗漏或逻辑断层。文档即版本控制 所有生成的 spec.md、plan.md 和 tasks.md 建议提交到 Git 仓库,作为项目演进的历史上下文进行保留与追踪。验证需要闭环 Spec-Kit 负责到“代码生成完成”为止,它不包含运行时测试能力。对于 UI 或端到端验证(E2E),建议配合 Playwright、Shiplight 等测试框架形成质量闭环。