分类导航

发现更多优质 AI 工具

全部 编程代码 创作写作 视频音频 图像视觉 学习辅导 办公效率 设计创意 大模型 提示词 Skills 自动化 知识库 开源&免费 副业
WhisperSubTranslate图标

WhisperSubTranslate

WhisperSubTranslate 实用指南一、平台介绍类型:本地桌面工具(Windows)技术架构:基于 Whisper.cpp(语音识别) + 翻译模型核心特点:100% 本地运行(可离线),无需联网即可使用无需账号 / 无需上传视频,隐私安全有保障开源(GPL-3.0),源代码公开核心定位:实现 “视频 → 自动字幕(SRT)→ 多语言翻译” 的一体化工具二、主要功能字幕生成(核心功能)从视频音频中识别字幕(Speech-to-Text)支持 100+ 种语言 的语音识别字幕翻译离线翻译:内置 Hy-MT2 模型,无需网络在线翻译:可接入以下服务配置 APIMyMemory(免费)DeepLOpenAIGemini本地化优势视频文件不上传云端,数据不出本地支持完全离线处理流程所有处理数据均保存在本地实用功能扩展自动模型下载(无需手动配置环境)队列处理(支持批量任务)字幕时间轴修复(针对长视频同步优化)GPU / CPU 性能自动适配三、适用人群适合以下用户使用:🎬 视频创作者(如 YouTube / B站 UP 主)🎓 外语学习者(用于观看外语课程或教材)🎧 字幕翻译人员(用于本地化工作)🧑‍💻 技术用户(希望避免折腾 Python 或命令行)🔐 注重隐私者(不希望上传视频至第三方服务器)👉 特别推荐场景:长视频(如课程、访谈、会议录音)的字幕制作与多语言处理。四、免费 / 付费情况软件本身费用完全免费 + 开源无订阅制、无需注册账号可能产生的额外费用(可选)若选择使用“在线翻译 API",需自行承担对应服务商的费用:MyMemory:免费使用,但有调用次数限制DeepL:提供少量免费额度,超出后按量收费OpenAI:付费模式,按 Token 数量计费Gemini:提供免费或低价额度(推荐低成本方案)定价参考说明翻译 API 需自行申请 Key 并遵循其官方定价五、如何使用下载与安装进入项目 Releases 页面下载 ZIP 压缩包解压后直接运行 .exe 程序即可启动生成字幕将视频文件拖入软件界面选择识别模型(推荐 large-v3-turbo)点击开始,自动生成 .srt 格式字幕翻译字幕(可选)选择翻译模式:本地模型(离线)或配置 API(在线高质量)导出文件输出标准的 SRT 格式字幕字幕可直接用于 VLC、各类剪辑软件等播放器六、注意事项功能边界限制❌ 不支持提取视频中已有的字幕轨道❌ 不支持识别画面中的文字(无 OCR 功能)硬件性能要求大模型需要一定的内存与显存(建议 2GB~8GB+)若无 GPU 也能运行,但速度会相对较慢翻译限制说明免费 API 存在调用额度上限处理长视频时建议优先选择 Gemini / DeepL 或本地模型长视频同步问题可能出现的字幕漂移现象解决方案:使用 Sync 模型 进行时间轴修复七、一句话总结本地 AI 字幕工具(识别 + 翻译) 免费、离线、无上传风险,非常适合长视频字幕制作与多语言处理。

Lieflat Charts图标

Lieflat Charts

lieflat-charts一、平台与项目介绍项目名称:lieflat-charts。开发团队:moxt.ai 团队。核心定位:面向 AI Agent 的数据可视化 Skill(技能)。技术规范:基于 SKILL.md 规范开发。主要痛点:旨在解决常规 AI 直接生成图表时存在的“样式粗糙、无排版逻辑、色彩杂乱”等问题。核心价值:AI Agent 安装此 Skill 后,可直接根据数据生成设计感极强、支持交互的 HTML 独立图表或完整报告网页。二、主要功能特点三大核心视觉体系(64+ 种图表组件)Lupi 系(编辑叙事型):采用发丝线、点阵、真实数据原子与大量留白,适合长文、论文、深度研报。Glance 系(快速判断型):粗笔画、大数字、高对比度,主打"3 秒看清趋势与异常”,适合周报、Dashboard 与 PPT 汇报。Basics 系(基础型):针对稀疏数据优化,重构经典的柱状图、折线图、环形图。完整 HTML 报告生成(Report Mode)模板数量:提供 12 款中英双语全页报告模板。适用场景:涵盖商业数据分析、财务研报、产品记录、个人 Log/海报等场景。配色与暗黑模式自动匹配:默认根据数据结构自动匹配 Mono(单色/灰阶)、Porcelain、Palm、Wire 等色彩预设。自定义支持:亦可由用户自定义品牌色。原生响应式与交互性技术栈:生成的均为原生纯 HTML/JS 页面。功能特性:自带优雅的动画、悬浮提示和高保真排版。环境要求:无需依赖任何第三方复杂的打包环境。三、适用人群AI Agent 开发者 / 高阶使用者:使用 Claude Code、Codex、Moxt 等平台的开发者,需让 Agent 具备高颜值出图能力。数据分析师 / 市场研究员:需要快速将 CSV、JSON 或论文研究数据转化为出版级图表或报告的从业者。产品经理与职场白领:需要高效制作周报、月报、Dashboard 汇报页面的用户。四、免费 / 付费情况开源费用:lieflat-charts 项目本身采用 MIT 许可证 彻底开源免费,代码公开在 GitHub。相关服务收费:运行该 Skill 所需的 AI Agent 平台(如 Claude Code, Codex 等)由第三方按各自标准收取 API/订阅费用。官方环境:若配合官方推荐的原生开发环境 Moxt 使用,可查看其官网:https://moxt.ai。安装成本:开源项目本身无定价页面,使用 GitHub clone 或 npx 安装全过程无额外费用。五、如何使用安装方式(二选一)命令行一键安装(推荐)bashnpx skills add https://github.com/larashero3-dotcom/lieflat-charts --skill lieflat-charts AI Agent 交互安装:终端直接发指令:“请帮我安装 lieflat-charts,Clone https://github.com/larashero3-dotcom/lieflat-charts 到 ~/.claude/skills/lieflat-charts(Codex 环境请改为 ~/.codex/skills/lieflat-charts)”常用 Prompt 调优示例做单图:输入指令“用 lieflat-charts 将这份 CSV 转换成 Glance 风格的图表,适合放到演示 PPT 中。”生成整页报告:输入指令“分析这份周报数据,提炼核心结论,用 lieflat-charts 生成一份完整 HTML 格式的数据汇报页面。”六、注意事项与踩坑点环境兼容性:需确保使用的 Agent 终端支持执行 Shell 命令或支持读取 SKILL.md 规范(如 Moxt, Claude Code, Codex 等)。图表数量控制:项目设计原则为“一图表达一独立结论”。单页报告建议图表数量不超过 6 张,过多图表会导致排版过于拥挤。颜色自定义原则:允许传入品牌主色(Brand Color),但建议保持其内建的阶梯对比度,避免传入过于刺眼或对比度极低的高饱和度色彩。触发词明确:默认 Agent 只会生成单个独立的图表;只有当 Prompt 中明确包含“报告”、“年报”、“白皮书”、“海报”等叙事词汇时,才会触发 12 全页模板生成模式。

Dashi PPT Skill图标

Dashi PPT Skill

Dashi-PPT-Skill 精简实用指南一、平台介绍 Dash PPT Skill 是一个面向 AI Agent 的 PPT 生成工具。 核心功能:把文档交给 AI,自动生成完整 PPT,浏览器可直接编辑,一键导出 PPTX/PDF。 核心特点:生成加编辑加导出一体化流程生成结果本身就是一个网页 PPT 编辑器支持 AI 自动结构化内容二、主要功能自动生成 PPT根据文档或需求自动生成完整结构支持场景包括:分析报告、项目汇报、路演等多主题模板包含 12 套视觉主题提供 1000+ 页面版式支持整套风格一键切换可视化编辑(核心亮点)每一页带有控制台,包括滑杆和开关可调布局、模块数量、重点和配色文本可直接点击修改图表与分析模型支持甘特图、漏斗、桑基图、热力图支持 SWOT、波特五力、PEST 等分析模型导出能力支持 HTML(离线可用)支持 PDF支持可编辑 PPTX(重点功能)三、适用人群 适合使用场景:职场人(汇报、方案、复盘)咨询、投资、分析人员产品经理、运营人员AI Agent 使用者(如 Claude、Codex)不太适合的场景:需要像素级设计的设计师场景四、免费与付费情况:开源免费,采用 AGPL-3.0 协议允许商业使用,但如果做 SaaS,需要开源你的修改代码补充说明:无官方定价页面,暂未提供付费套餐有商业授权需联系作者,非公开定价五、如何使用(最简流程)安装执行命令:npx dashi-ppt-skill@latest环境要求:Node.js 20+,本地浏览器用于导出生成 PPT给 AI Agent 输入指令:帮我用这个 skill 生成一份 PPT(主题加页数加受众)操作流程输入需求,包括主题、受众、页数选择模板风格自动生成内容结构浏览器中直接编辑导出 PPTX 或 PDF编辑方式点击文字直接修改拖拽图片进行替换使用控制台调整布局、配色和模块六、注意事项(重要)必须本地运行不适合纯网页 ChatGPT 使用需要本地 Node 环境导出依赖浏览器必须安装 Chrome 或 Edge否则无法导出 PPTX/PDF内容安全文档不会上传服务器全部本地处理,隐私友好Token 成本高(AI 侧)10 页 PPT 约消耗 10 万 tokens,成本较高自定义受限不支持完全自由设计,为了稳定输出七、一句话总结 它不是单纯的 PPT 生成器,而是 AI 加可编辑 PPT 系统。 核心价值: 快速生成结构,同时保留可控编辑能力

DBX图标

DBX

DBX 平台使用指南一、平台介绍DBX 是一个开源数据库工作台(Database Workspace),把数据库日常操作(连接、SQL、数据查看、结构分析、AI 辅助等)整合到一个工具里。核心特点:一个工具管理 70+ 数据库支持桌面版 + Docker 自托管 Web 版内置 AI 助手强调“轻量 + 高效工作流”完全开源免费二、主要功能1. 数据库连接支持多种类型:MySQL / PostgreSQL / Redis / MongoDB / Oracle 等支持 SSH 隧道、代理连接,解决内网访问问题2. SQL 编辑器提供自动补全、语法高亮、格式化功能记录查询历史,方便回溯支持选中执行 SQL 脚本3. 数据管理(类似 Excel)表格查看、筛选、排序行内编辑 + SQL 预览支持数据导入/导出4. 数据库结构分析Schema 浏览生成 ER 图字段血缘分析Schema 对比(环境差异)5. 数据迁移与同步数据导入/导出SQL 文件执行跨数据库传输6. AI 助手自然语言生成 SQL查询解释与优化错误修复建议7. 自托管访问Docker 部署浏览器访问(适合团队共享)三、适用人群适合以下用户:开发者 / 后端工程师日常写 SQL、查数据、调试数据库数据分析师快速查询、导出数据、做分析运维 / DBA管理多数据库环境做结构对比、数据迁移团队协作用 Docker 部署统一数据库入口四、免费 / 付费情况✅ 完全开源(免费)❌ 官网暂无商业付费版本或定价页面AI 功能需要自行提供 API Key(如 OpenAI)产生费用来自第三方接口,官方不直接收费五、如何使用(快速上手)参考官方指南:https://dbxio.com步骤(简版):安装:下载桌面版 / 或 Docker 部署新建连接:选择数据库类型,填写 host / 用户名 / 密码测试连接:成功后保存配置开始使用:写 SQL、查看数据、分析结构六、使用注意事项生产环境谨慎操作:所有修改操作建议先查看 SQL 再执行,防止误操作AI 生成 SQL 不会自动执行:必须人工确认(防误删数据)连接安全:密码单独加密存储,支持 SSH 隧道访问内网数据库环境区分:建议用颜色区分:开发 / 测试 / 生产环境版本适用性:桌面版适合个人使用;Web 版适合团队共享七、一句话总结👉 DBX = 轻量级 + 多数据库 + AI 辅助的一体化数据库管理工具(开源免费版 DataGrip 替代)

LuxTTS图标

LuxTTS

LuxTTS 完整指南一、平台介绍LuxTTS 是一个开源的文本转语音(TTS)+ 声音克隆模型,主要特点如下:极快速度:推理速度约为 150 倍实时。高质量语音:输出采样率为 48kHz(高于常见的 24kHz)。轻量可本地部署:仅需约 1GB 显存 即可运行。👉 本质定位: 这是一个“可本地运行的高质量语音克隆引擎”,非常适合用来替代传统的云 TTS 服务。二、主要功能1. 声音克隆(核心卖点)零样本克隆:无需训练即可实现。同音色生成:使用一段参考音频 → 直接生成同音色的语音。2. 高质量语音输出高音质:支持 48kHz 采样率,远超行业平均水平。自然语调:拥有更自然的韵律(Prosody)。3. 超高速推理GPU 加速:最高可达 150x realtime。CPU 可用:支持在 CPU 环境下实时生成(适合弱算力设备)。4. 风格控制(进阶)多参数控制:可精细控制语速、情绪、音量。采样调优:支持调整 sampling 相关参数以获得最佳效果。5. 轻量 & 可部署显存低:仅需约 1GB 显存。多环境支持:兼容本地环境、Colab 云端以及 HuggingFace Spaces。三、适用人群该项目明确适合以下三类用户群体:技术类开发者AI 开发者(构建语音系统 / 数字人)。后端工程师(开发语音 API 接口)。开源玩家或希望自部署的用户。内容创作者视频配音(如 YouTube、抖音)。播客制作或有声书录制。AI 虚拟人构建。企业应用场景呼叫中心(客服语音)。教育与无障碍语音辅助。游戏内的动态语音生成。四、免费 / 付费情况✅ 开源政策(当前)License:采用 Apache-2.0 协议。商用权限:允许商用(需遵守相应协议)。🚫 付费服务说明无官方 SaaS 定价:不存在官方收费套餐。无官方 API 计费:没有官方的 API 调用计费页面。👉 关于“付费”: 通常涉及成本的方式是使用第三方部署平台(如 fal.ai)或支付云 GPU 运行成本。五、如何使用1. 安装依赖bashgit clone https://github.com/ysharma3501/LuxTTS.git cd LuxTTS pip install -r requirements.txt 2. 加载模型pythonfrom zipvoice.luxvoice import LuxTTS lux_tts = LuxTTS('YatharthS/LuxTTS', device='cuda') 3. 准备参考声音(关键步骤)输入文件:例如 audio.wav。编码处理:执行以下代码进行编码。pythonprompt_audio = "audio.wav" encoded = lux_tts.encode_prompt(prompt_audio) 4. 生成语音文本输入:如 "你好,这是一个测试"。执行生成:调用 generate_speech 函数。pythontext = "你好,这是一个测试" wav = lux_tts.generate_speech(text, encoded) 5. 保存音频文件使用 soundfile 库将生成的波形数据保存为文件。pythonimport soundfile as sf sf.write("output.wav", wav.numpy(), 48000) 👉 一句话总结流程: 文本 + 参考声音 → 输出克隆语音六、进阶参数在使用模型时,可通过以下参数进行调优:num_steps作用:数值越大音质越好,但速度越慢。推荐值:3~4 为性价比最高区间。t_shift作用:用于在发音准确性和整体音质之间进行权衡。speed作用:控制生成语音的语速快慢。rms作用:控制输出音频的整体音量。return_smooth作用:启用或关闭降噪/平滑处理功能。七、注意事项参考音频质量决定上限时长建议至少 3 秒以上。音频需清晰,避免背景噪音过大。首次运行慢(正常现象)加载 librosa 库初始化约需 10 秒,属正常等待时间。多语言支持不稳定Issue 中反馈存在混合语言问题。部分发音异常情况可能出现在非英语或中文混合场景。常见问题与解决出现杂音或截断:尝试调低 t_shift 值或增加 num_steps。声音不像原音:建议更换更高质量的参考音频片段。硬件建议GPU 推荐:≥ 8GB 显存运行更稳定。CPU 模式:可用但生成性能有限,适合轻量任务。八、优缺点总结👍 优点列表开源可商用:协议宽松,商业风险低。极快推理速度:在同类模型中表现行业领先。资源占用轻量:本地可跑,适合个人或小团队。声音克隆能力强:零样本效果优秀。👎 缺点列表无官方 UI:需要自行开发前端界面或集成。多语言支持待完善:中文及部分小语种仍在优化中。技术门槛要求:需要一定的 Python/深度学习背景。

有戏图标

有戏

有戏 AI 使用指南平台介绍风平智能旗下的国内 AI 短剧一站式网页创作平台。使用方式:无需客户端,直接在浏览器中使用。核心流程:把剧本自动拆解分镜、AI 生图、图生视频、配音对口型全链路打通。专注领域:专门做漫改短剧、AI 微短剧。导出优势:支持导出剪映草稿工程文件,不用后期重新剪辑。注册门槛:需要手机号注册,内测阶段部分情况需要邀请码。主要功能剧本解析:支持最高5 万字剧本导入,自动分集、拆分分镜、识别角色/台词/场景;也可利用 AI 随机生成剧本底稿。角色锁一致性:锁定人物形象,跨分镜、跨集保持人物长相穿搭统一。批量生图&转视频:故事板批量生成画面,一键图生视频;支持剧情模式、旁白解说模式两种项目类型。AI 配音对口型:多音色 TTS,自动台词对齐口型,可单独调整每段语速语调。导出能力:输出MP4 成片或剪映草稿工程文件,字幕、音频、片段自动对齐,方便二次精细修改。算力消耗说明:生图、生视频需消耗平台算力(积分),文本剧本解析不扣算力。适用人群✅ 适合人群:短剧创作者、自媒体运营、漫剧/图文短视频博主、MCN 小团队、剧本爱好者。❌ 不适合人群:专业电影级生产需求用户;无剧本只想随手生成短视频的普通用户。免费&付费情况免费部分详情新用户福利:注册赠送初始算力(100‑200 算力,版本浮动),可体验完整功能;邀请奖励:邀请其他用户注册可免费获取额外算力;消耗规则:所有生成功能均会消耗赠送的或购买的算力。付费与充值详情购买方式:充值购买算力包(无公开独立定价网页);查看路径:登录平台后进入个人中心→算力充值页面查看具体价格;入口链接:https://youxi.fullpeace.net → 个人中心→算力充值页面。如何使用注册登录:浏览器打开官网,使用手机号注册,部分场景需填写邀请码登录。新建项目:首页点击【开始创作】,填写剧名,选择「剧情模式」或「旁白解说模式」。编写剧本:导入剧本文本,或者利用 AI 生成剧本底稿,系统自动生成分镜;支持手动修改台词、提示词、角色设定。生成分镜:进入故事板页面,批量生图,预览画面;不满意可单独重绘分镜。制作视频:批量生成视频,设置配音音色、语速,开启 AI 对口型功能。导出成果:输出MP4 视频文件,或者导出剪映草稿至本地剪映(PC 版)继续编辑。注意事项算力与稳定性:生成图片、视频均消耗算力,批量生成时算力消耗较快;内测版本批量任务偶有失败或卡住,需要重新提交任务。角色一致性限制:角色一致性不能保证 100% 完美,复杂镜头仍会出现人物崩坏,重要镜头建议单独重绘。导出兼容性:导出剪映草稿仅适配剪映 PC 版,手机剪映不支持工程草稿导入。版权与合规:平台生成内容商用需要自行确认授权,短剧发布需遵守短视频平台审核规则。版本动态调整:处于迭代内测阶段,功能、算力赠送额度、充值价格会不定期调整。剧本上传建议:大剧本一次性导入时,建议分段上传,以减少解析失败概率。

百度生花图标

百度生花

百度生花使用指南一、平台介绍百度生花是百度旗下的 AI 短剧/短视频创作平台。该平台面向 短剧创作者、内容商家,主打 脚本直接生成 AI 短剧成片 的能力。平台支持 分镜编辑、数字人 应用及 批量生产,并可实现一键分发至 百家号/百度系流量渠道。技术底层依托 文心大模型 与 蒸汽机视频模型,采用 Web 网页端 操作模式,用户 无需下载客户端。二、主要功能脚本生短剧:支持粘贴完整剧本,由 AI 自动拆分镜头并生成完整 AI 短剧;适配 竖屏 9:16 比例,符合 短视频平台 发布规范。分镜可视化编辑:支持对单镜头进行提示词修改、画面替换、时长调整及数字人形象更换等精细化操作。数字人能力:内置多种 数字人 形象,支持台词配音、多音色选择,并提供 方言 支持。素材库:提供人物、场景、道具等 模板素材;支持 图生视频 功能,可将单图扩展为动态片段。成片处理:自动添加字幕与背景音乐,最终导出标准 MP4 格式视频。一键分发:支持直接发布至 百家号,对接百度内容流量;提供作品管理及历史工程保存功能。三、适用人群适合人群:短剧创作者、自媒体、MCN 机构、电商商家、百家号内容从业者,适用于批量制作剧情类短视频的需求。不适合场景:需要 电影级高精度影视制作 的场景;需要本地化部署及私有化环境的项目。四、免费付费情况免费额度:新用户注册后会赠送一定创作积分;每日提供少量免费额度;生成短剧会消耗积分,免费额度仅适合少量测试使用。付费模式:采用 积分预付费 机制,用户需购买积分包后消耗积分进行生成;长剧集、高清画质、数字人功能会消耗更多积分。定价页面:具体积分购买链接为 https://shenghua.baidu.com/videoplatform/buy;无按月订阅模式,按消耗计费;企业大客户可联系商务洽谈定制套餐。五、如何使用打开浏览器访问 https://shenghua.baidu.com/videoplatform/home 网址。使用 百度账号 扫码完成登录认证。新建项目,选择粘贴完整剧本脚本;或直接使用 AI 生成脚本。AI 自动将脚本拆分为分镜,支持预览每个镜头;可手动修改镜头画面描述、人物设定及时长。设置分辨率、音色、背景音乐参数,点击生成视频(消耗对应积分)。等待渲染完成后预览成片,支持二次微调调整;最后选择导出 MP4 或一键分发至 百家号。进入“我的作品”模块管理所有工程,支持反复编辑旧项目文件。六、注意事项网络环境:国内网络可直接访问,无需特殊网络配置;高峰期渲染可能需要排队,长剧等待时间较长。积分限制:免费积分额度有限;大量批量生产务必购买积分包,额度耗尽后将无法生成视频。画面质量:AI 生成画面可能出现人物五官崩坏或动作怪异,建议对重要镜头进行单独重生成。版权规范:平台生成内容仅限合规商用;不允许生成暴力、色情、侵权剧情,违规可能导致账号封禁。视频水印:导出视频默认带有水印,部分付费档位可去除平台水印。脚本要求:脚本质量直接决定成片效果,尽量写清楚镜头描述,避免仅写对话内容。文件备份:工程文件采用云端保存,建议对重要成片进行本地下载备份,防止平台清理过期项目。审核机制:分发至百家号需遵守平台内容审核规则,AI 短剧也会经过机器审核,请确保内容合规。

RVC图标

RVC

RVC1. 平台介绍Retrieval-based Voice Conversion WebUI (RVC) 是一个开源的 V2V(Voice-to-Voice,语音到语音) 声音变换与克隆框架。它基于 VITS 架构 与 基于特征检索(Retrieval-based) 的技术改进,核心能力在于能够把源音频的音色替换为目标 Speaker 的音色,同时保留原语音的 语调、情感和节奏。2. 主要功能推理转换(AI 翻唱 / 变声):支持上传干声/语音并选择模型以生成目标音色的音频。用户可调整 变调(Pitch)、变音算法(如 RMVPE, PM, Harvest, Crepe)及音色融合度。模型训练(声音克隆):仅需 10~20 分钟 干净的目标语音干声即可训练出专属音色模型。实时变声(GUI):配合虚拟音频线(如 VB-Cable)与低延迟驱动(ASIO),可在 Discord、游戏、直播等场景中实现低延迟实时变声。辅助工具:人声伴奏分离:内置人声与伴奏切分工具。模型融合(Ckpt Merge):可将多个音色权重进行比例叠加,混合出新的音色。3. 适用人群VTuber / 游戏主播 / 内容创作者:用于实时变声或制作角色语音包。AI 音乐爱好者:用于制作 AI 歌手翻唱(AI Cover)。配音员 / 音频工程师:用于修正人声音效或做音色替换。4. 免费/付费情况完全免费与开源:项目基于 MIT 许可证 开源,费用为 100% 免费,支持离线部署运行。源码与更新地址:项目托管于 GitHub - RVC-Project/Retrieval-based-Voice-Conversion-WebUI。5. 如何使用(快速上手指南)硬件与环境准备操作系统:支持 Windows / Linux / macOS。硬件建议:推荐使用 NVIDIA 显卡(建议 6GB 及以上显存;纯 CPU 可运行但推理/训练极其缓慢)。下载与启动从 GitHub Release 页面下载整合包(预安装环境与依赖)。解压后点击 go-webui.bat 启动 WebUI 界面,默认会自动打开浏览器访问 http://127.0.0.1:7865。(如需实时变声)运行 go-realtime_gui.bat。音色推理(转换声音)切换到 “模型推理” 选项卡。将训练好的 .pth 模型文件放入 assets/weights/ 目录,将对应 .index 文件放入 assets/indices/。点击“刷新音色列表”,选择目标模型。上传需要转换的音频文件。调节关键参数:变调(Pitch/Key):男声变女声通常设置为 +12,女声变男声 -12;若是同性别翻唱保持 0。音高提取算法:优先推荐 RMVPE(效果最好且速度快、不哑音)。检索特征占比:建议保持 0.6 - 0.75,防止漏音。点击 “转换” 并导出音频。模型训练(自制音色)切换到 “训练” 选项卡。步骤 1:输入实验名称,选择采样率(推荐 40k/48k)与是否包含音高 F0。步骤 2a:指定训练干声文件夹路径,点击“处理数据”。步骤 2b:选择 RMVPE 算法提取特征和音高。步骤 3:设置总训练轮数(Epoch,建议 100~300),点击“训练模型”与“训练特征索引”。6. 注意事项数据质量决定一切:训练素材务必使用无噪音、无伴奏、无重度混响的 干净干声。有杂音的数据会导致输出有电音或破音。版权与肖像权安全:切勿将未经授权的他人音色模型用于公开发布、商业用途或欺诈行为。算法选择:推理和提取音高时优先使用 RMVPE。以前常用的 Harvest 耗时极长,PM 容易变哑音。路径不能包含中文:存放 RVC 项目文件及音频数据集的目录路径中 严禁包含中文或特殊字符,否则容易引发 PyTorch 加载报错。

GPT-Image2图标

GPT-Image2

GPT-Image2 工业级提示词引擎平台GPT-Image2.canghe.ai 是由知名开发者 苍何 推出的 GPT-Image2 工业级提示词引擎与视觉案例展示平台。该平台将 GPT-Image2 的 Prompt 抽象为“可重用的代码”(Prompt as Code),提供实战案例库、提示词复制、交互式在线绘图测试及 Agent 技能扩展。一、平台介绍核心定位:GPT-Image2 工业级提示词引擎、视觉案例工坊与 Prompt 模板库。平台主页:https://gpt-image2.canghe.ai开源生态:开源于 GitHub 仓库 freestylefly/awesome-gpt-image-2。二、主要功能爆款案例展示库:提供涵盖摄影人像、电商产品、品牌 Logo、插画艺术、UI 海报等多种场景的优质案例。一键复制 Prompt:直观展示精准调校的完整提示词,支持一键复制直接使用。在线生成测试:登录后可在网页端输入提示词并调用 GPT-Image2 模型直接生成图片。风格与场景筛选:按案例分类、风格标签(如 3D、超写实、复古海报等)快速检索。Agent Skills & MCP 集成:提供本地 Agent 命令行工具,可直接将风格库嵌入 Claude Code、Cursor 等 AI 开发工具中。三、适用人群AI 绘画 / 视觉创作者:寻找高清案例参考与精准 Prompt 结构。电商运营与设计师:生成产品图、营销海报、UI 概念图及带精确文字的设计稿。AI 开发者 / Agent 工程师:将 GPT-Image2 提示词库接入本地 Agent 辅助开发。四、免费与付费情况平台采用部分功能免费 + 增值付费社区的形式:免费功能:案例浏览、提示词复制、开源 GitHub 模板库均免费开放。付费社群:价格:一次性支付 ¥9.90(支付宝付款)。权益:解锁 GPT-Image2 核心交流群二维码及技术讨论资源。API 扩展合作(生成/算力):平台引荐了第三方 API 服务商(如 hiapi、APIMart),新用户注册赠送额度,后续按量计费。最新定价与社群方案查看:进入网站后点击页面上的 Community / 付费社区 标签查看最新支付与进群说明。五、如何使用浏览与搜图:打开网页,根据顶部分类(如 Products、Illustration、Posters)挑选心仪的视觉效果。复制提示词:点击案例卡片上的 Copy Prompt 按钮即可复制完整的提示词(含变量或特定结构)。在线测试:点击 Generate Test,使用 Google 账号 登录后,即可在网页端在线调用 GPT-Image2 模型体验出图。本地开发者集成:在终端运行命令,将风格库添加至 Claude Code 或 Cursor 等工具中:bashnpx skills add freestylefly/awesome-gpt-image-2 --global --all --copy 六、注意事项登录限制:在线生图功能依赖第三方 Auth 验证(Google 登录),请确保网络连接通畅。生成额度与接口:在线生图可能受到 API 代理额度限制,如需大批量生图,建议配合后端 API(如 hiapi 等)或本地 Client。Prompt 占位符处理:部分工业级 Prompt 包含 {Object}、{DESTINATION} 等占位符,复制后需根据自己的需求替换其中的关键字再提交生图。

Xagent图标

Xagent

XAgent 平台使用指南一、平台介绍核心理念:倡导“描述结果,而非工作流(Describe tasks. Not workflows.)”。差异化特点:区别于 Dify / Coze 等依赖硬编码拖拽式 Flowchart(工作流)的平台,Xagent 强调自主规划(Dynamic Planning)与工具调度。用户只需输入最终目标,平台即可自动进行任务分解、工具调用、自我评估与迭代交付。核心定义:由 Xorbits 团队开源的面向个人、团队与企业的动态任务执行引擎与 AI Agent 协作平台。二、主要功能动态任务规划 (Dynamic Planning)根据目标在运行时(Runtime)自动拆解多步骤子任务。支持自动反射机制,遵循“计划→执行→反思”的流程逻辑。支持条件分支执行,适应复杂场景。工具与能力集成 (Tools & Knowledge Integration)模型支持:原生对接 OpenAI、Claude、DeepSeek、通义千问、Zhipu 等主流 API。私有化部署:无缝集成自建的 Xinference 本地/私有化模型。知识库与扩展:内置 RAG 知识库检索,支持文件读写分析及分析能力。插件规范:支持 MCP (Model Context Protocol) 插件规范及自定义 API 扩展。多 Agent 协作工作流 (Workforces Pattern)支持构建复杂的分布式 Agent 团队(如:规划者 + 调研员 + 程序员 + 审核员)。实现多角色协同分工,处理复杂业务逻辑。可复用 Agent 模版可将探索成功的单次任务模式(提示词、特定工具链、知识库权限)打包发布为模版。供团队内复用,降低重复开发成本。全流程可观测性 (Observability)实时跟踪 Agent 执行状态。提供思考日志、工具调用详情及 Token 消耗统计视图。三、适用人群个人开发者 / AI 玩家:需要比纯 Chat 界面更强的本地自动化 Agent 工具,适用于长文本处理、复杂数据分析及自主调研场景。团队 / 研发小组:需要将日常重复的业务逻辑打包成固定的 Agent 工具链,从而提升协作效率。企业级开发者:基于私有模型(如通过 Xinference 部署)搭建企业内部知识库、合规工具链与多 Agent 业务系统的专业团队。四、免费与付费情况开源状态:Xagent 核心代码完全开源,基于标准开源协议开放,个人与企业均可免费自建部署。社区自建版:免费。支持使用全量功能,仅需自行承担模型 API 消耗或本地显卡算力费用。商业服务与定价:关于 SaaS 云服务、企业级 SSO 或专属服务支持的最新动态。建议随时查看官方定价页面([https://docs.xagent.co/](https://docs.xagent.co/))获取最新信息。五、如何使用方式 1:单机快速安装(推荐体验)确保环境满足 Python 3.11+ 要求。执行安装命令:pip install xagent-ai (或使用 uv tool install xagent-ai)。启动服务:运行 xagent 命令。浏览器访问 http://127.0.0.1:8000。在 /setup 页面创建管理员账号,并配置 LLM Provider 即可开始使用。方式 2:Docker 容器化部署(适合团队/服务器部署)克隆仓库并配置环境变量: 运行 git clone https://github.com/xorbitsai/xagent.git 后进入目录 cd xagent。复制示例环境文件:执行 cp example.env .env。一键启动 Docker 服务:运行 docker compose up -d。浏览器访问 http://localhost:80 进入 Web UI 管理界面。六、注意事项模型能力要求:由于采用动态规划(Dynamic Task Planning)模式,Agent 的逻辑推理与工具调用非常依赖底层 LLM 的质量。建议优先选用 Reasoning 能力强或 Tool Call 效果好的模型(如 Claude 3.5 Sonnet、GPT-4o、DeepSeek-V3/R1)。死循环与 API 消耗:Dynamic Engine 在无法完成任务时可能会自主尝试多次重试。建议在后台系统设置中配置单次任务的最大步数(Max Steps)与 Token 阈值,避免无限循环导致 API 账单超支。环境隔离与安全:若允许 Agent 执行 Code/Bash 工具,请确保运行在 Docker 或隔离的虚拟环境中,避免对宿主机敏感数据产生潜在风险。

Code2Video图标

Code2Video

Code2Video 使用指南Code2Video 是由新加坡国立大学(NUS)Show Lab 开发的开源 AI 项目,该项目已接收于 ICML 2026。它提出了一种以代码为中心(Code-centric)的教学视频生成新范式,通过生成并执行 Manim 代码来创建高质量的科普与教学视频。一、平台与项目介绍官方开源地址:访问 GitHub - showlab/Code2Video 获取最新源码。核心理念:传统 AI 视频生成(如 SORA、Runway 等像素级生成模型)在处理逻辑严密、结构复杂的教学或数学视频时易出现内容幻觉或字迹模糊。Code2Video 引入大语言模型生成 Python 的 Manim 动画代码,利用代码控制视频的时间轴与空间布局,实现精确、高清晰度且可重现的教学动画。二、主要功能多 Agent 协作生成(Modular Tri-Agent Design):Planner(规划器):将输入知识点拆解并扩写为视频脚本分镜。 Coder(代码生成器):自动合成并调试 Manim 代码。Critic(审查与优化器):结合多模态大模型(VLM)评估画面布局与视觉效果,迭代修正渲染效果。知识点自动转换为动画:输入任意自然语言知识点(如“矩阵线性变换”、“傅里叶级数”),自动生成配套动画与讲解视频。集成图标与素材库:支持通过 IconFinder API 自动匹配并下载相关图标素材,丰富画面表现力。内置评估基准 MMMC:提供包含 117 个精心挑选的教学主题基准(受 3Blue1Brown 启发),用于评测视频的知识传递效率与美观度。三、适用人群教育工作者与教师:快速制作精确的科普课件与数学/物理概念动画。科普/自媒体内容创作者:高效生成 3Blue1Brown 风格的精美讲解视频。AI & 计算机视觉研究人员:探索 Agentic 代码生成、多模态代码驱动视频生成方向。四、免费与付费情况开源免费:项目代码本身完全 开源免费,采用 MIT 开源协议。第三方 API 成本(使用过程中产生): 3. LLM / VLM API 费用:项目依赖第三方大模型 API 服务,需自行付费购买 API Token。 4. LLM/VLM 推荐选型:官方建议使用 Claude-4-Opus 生成代码,使用 Gemini-2.5-Pro 用于布局优化。 5. IconFinder API 费用(可选):若需要自动抓取图标素材,可使用 IconFinder 免费配额或购买套餐。官方定价方案网址:项目本身无官方付费版,调用的第三方 API 定价可参考各自官方页面: 7. Anthropic (Claude) 定价页面:https://www.anthropic.com/pricing 8. Google AI Studio (Gemini) 定价页面:https://ai.google.dev/pricing五、如何使用(快速上手)1. 环境准备与安装克隆项目仓库并进入代码目录:bashgit clone https://github.com/showlab/Code2Video.git cd Code2Video/src pip install -r requirements.txt 注:需确保系统已安装 Manim Community (v0.19.0) 及其依赖环境(如 System 级别的 ffmpeg、LaTeX 等),否则后续渲染可能会失败。2. 配置 API Key在 src/api_config.json 中配置所需的密钥: 2. LLM API(Planner 与 Coder 使用)。 3. VLM API(Critic 使用,如 Gemini 密钥)。 4. IconFinder API Key(可选,用于自动收集图标)。3. 运行生成脚本单个知识点生成模式:bashsh run_agent_single.sh --knowledge_point "Linear transformations and matrices" 批量基准测试/多主题生成模式:bashsh run_agent.sh 六、注意事项渲染环境依赖:由于底层依赖 Manim 引擎,宿主环境必须提前配置好 ffmpeg 及 LaTeX 渲染器,否则代码合成后可能会因环境缺失导致渲染失败。API 选型影响质量:高质量的 Manim 代码极其依赖大模型的能力。官方建议代码生成优先选用 Claude-4-Opus,视觉批评(Critic)优先选用 Gemini-2.5-Pro,使用效果一般的模型可能会导致代码编译报错率升高。生成的渲染时间:与基于像素扩散的模型不同,代码渲染的时间主要取决于 Manim 本身的渲染逻辑与 CPU/GPU 性能,复杂动画渲染可能需要一定计算时间。

Google Code Wiki图标

Google Code Wiki

Google Code Wiki 平台指南一、平台介绍与定位核心定义: Google Code Wiki (codewiki.google) 是谷歌推出的 AI 驱动代码文档生成 与 代码库理解 专用平台。核心价值: 解决了 “代码阅读”作为开发效率最大瓶颈 的问题,旨在替代传统静态/易过期的 README 文件。主要产出: 为整个 GitHub 仓库自动生成并维护动态的、结构化的文档系统。二、核心功能特性自动化动态文档:自动解析代码库的架构、模块、API 和类定义;当发生 Commit/PR 合并 等更新时,文档会自动重新生成并保持实时同步;智能超链接跳转:文档中出现的任何概念、函数或类的描述均直接附带原代码文件与具体行数的跳转链接;架构图表自动生成:自动绘制架构图(Architecture Diagram)、序列图(Sequence Diagram)及类图,图表会随代码更新自动重绘;Gemini 驱动的代码对话:基于当前仓库的全量文档作为知识库提供实时 AI Q&A;回答中准确附带关键位置的 代码行级引用;AI 音视频概览:结合类似 NotebookLM 的技术,自动生成代码库的高级结构与架构流转的音视频导读。三、适用人群与场景开源项目贡献者 / 新入职员工: 快速理解陌生代码库,将 Onboarding(入职引导)成本降至最低;资深开发者 / 系统架构师: 在几分钟内理清大型或复杂项目的模块划分与底层技术架构;代码审查者 (Reviewer) / 维护者: 快速核对 PR 修改的影响范围,免除手动维护文档的繁重负担。四、免费与付费现状当前服务状态:**完全免费(Public Preview)**阶段;公共仓库开放使用,支持直接查询或提交 GitHub 公开仓库进行索引生成;私有/企业级支持计划:Google 正在开发 Gemini CLI extension,用于在本地/企业私有环境运行 Code Wiki;目前私有库功能处于 Waitlist 申请阶段;官方入口及定价页面链接:平台主页:codewiki.google;官方更新与公告页面:Google Developers Blog。五、使用指南直接网址拼接(最快捷):在浏览器地址栏输入格式为 codewiki.google/github.com/<owner>/<repo>;例如查询 React 仓库可输入:codewiki.google/github.com/facebook/react;搜索栏查询模式:访问 codewiki.google,直接在输入框粘贴公开 GitHub 仓库链接或搜索项目名称即可生成文档;互动与提问操作:生成文档后,使用右侧/下方的 Gemini 提问框(如询问“解释这个项目的鉴权流程”、“数据库模块由哪些文件处理”);点击生成的超链接即可查看对应的源码。六、注意事项与风险提示私有仓库支持限制:Web 版目前仅支持 GitHub 公开仓库 (Public),暂不支持直接挂载私有库查询,需等待 Gemini CLI extension 发布以解决本地/企业环境需求;AI 幻觉风险验证:文档基于结构化代码解析生成,复杂逻辑可能存在推断偏差,务必点击文档中的超链接核对关键业务逻辑与实现细节;超大仓库索引延迟:对于极其庞大的 Monorepo(单体仓库),首次生成或重新索引可能需要一定处理时间请耐心等待。