分类导航
发现更多优质 AI 工具
DeerFlow
DeerFlow 使用指南1. 平台介绍定位:由字节跳动(ByteDance)开源的 超级 AI Agent 运行框架。该框架也被定义为 "SuperAgent Harness",旨在解决复杂任务下的自动化执行难题。版本演进:已从最初的“深度研究(Deep Research)”工具升级为最新推出的 DeerFlow 2.0 全栈智能体执行环境。核心思想:为 AI Agent 提供一台独立的 “虚拟计算机”(基于 Docker 沙盒),使其能够打破文本生成的局限,支持以下能力:自主搜索与代码编写。程序运行与环境管理。生成网页或多媒体内容。文件系统管理与长流程任务执行(持续时间可从几分钟到数小时)。2. 主要功能特性渐进式技能系统(Skills System):支持按需动态加载特定领域的任务技能,例如深度研究、前端设计或代码部署等。这一机制避免了将海量提示词一次性注入导致的上下文膨胀问题(Context Rot),保持 Agent 思维清晰度。AIO 全功能沙盒(Docker Sandbox):集成了浏览器接口、Shell 终端环境、文件系统访问、MCP 协议以及 VSCode Server。Agent可以在该安全隔离环境中自主安装 Python 包、运行复杂代码逻辑并部署 Web 界面应用,无需依赖外部基础设施。多智能体协作与长任务拆解(Sub-Agents & Planning):主 Agent 负责将超复杂的长任务自动拆解为若干子任务,然后分发给不同专业领域的子 Agent 进行并行或串行处理,极大提升了执行效率。长短期记忆与上下文压缩:具备跨会话持久化能力,能够记录用户偏好、项目结构及历史上下文;系统会自动识别并压缩冗余的对话内容,优化 Token 消耗。多模型与工具扩展支持:原生兼容 Doubao(豆包)、DeepSeek、OpenAI、Gemini 等主流大模型接口;同时开放了 MCP (Model Context Protocol) 协议标准及自定义 Tools 的接入能力。3. 适用人群分析开发者 / AI 工程师:适用于需要搭建自动化代码生成流水线、执行数据清洗流程、实现服务自动部署以及构建智能体工作流的场景人员。科研人员 / 行业分析师:适合需要利用全网多源信息进行自动化检索、整理学术文献,并自动生成包含可视化图表的研究报告的人员。数据分析师 / 产品经理:适用于需自主完成探索性数据分析(EDA)、即时生成分析图表、制作 Demo 网页或现场演示 Slide 展示场景的专业人士。4. 免费付费情况说明开源政策:DeerFlow 项目采用完全免费的 MIT 协议。软件本身及包含的所有功能源码均对用户开放,官方无售卖平台亦无专属付费定价页面。自备成本(运行费用):虽然软件免费,但以下资源需用户自行准备或按量计费:API Key 消耗:使用 OpenAI、DeepSeek 或字节豆包等第三方大模型 API,以及 Tavily、Brave Search 等搜索引擎时产生的 Token 与调用费。算力成本:本地运行无需额外费用;若部署在云服务器(如 K8s 集群),需承担云主机的硬件租赁费用。官方资源链接:用户可前往以下地址获取最新代码库、安装说明及社区支持:官方网站:https://deerflow.tech/GitHub 仓库:https://github.com/bytedance/deer-flow5. 如何使用(快速上手指南)方式一:向 AI 编程助手发送指令若已配置好 Cursor、Claude Code 等 AI 编程辅助工具,可直接输入以下一键指令进行环境搭建与引导:bashHelp me clone DeerFlow if needed, then bootstrap it for local development by following https://raw.githubusercontent.com/bytedance/deer-flow/main/Install.md Help me clone DeerFlow if needed, then bootstrap it for local development by following https://raw.githubusercontent.com/bytedance/deer-flow/main/Install.md 方式二:命令行手动部署(推荐 Docker)前提准备:请确保系统已安装 Python (版本 >= 3.11)、Node.js (版本 >= 22) 、Docker 及 Git 环境。克隆项目并配置密钥:执行以下命令拉取代码,并将示例配置文件复制并重命名为 .env,填入您的 API Key:bashgit clone https://github.com/bytedance/deer-flow.git cd deer-flow cp .env.example .env # 填入 LLM API Key 和搜索 API Key git clone https://github.com/bytedance/deer-flow.git cd deer-flow cp .env.example .env # 填入 LLM API Key 和搜索 API Key 运行交互式配置向导:执行以下命令进入设置界面:bashmake setup make setup 向导将引导您选择 LLM 供应商、搜索引擎类型(如 Tavily/DuckDuckGo/Arxiv)及沙盒安全偏好。启动服务:配置完成后,运行容器化部署命令以拉起后端进程与前端界面:bashdocker compose up -d docker compose up -d 访问管理端:等待初始化完成后,在浏览器中打开 http://localhost:3000,即可通过 Web UI 下发复杂的 Agent 任务指令。6. 注意事项与风险提示沙盒安全隔离(高危):DeerFlow 在沙盒内部拥有代码及终端的完全执行权限。必须运行在 Docker 隔离环境中。切勿在宿主机裸机上直接开放未经限制的 Bash 写入权限,否则可能导致系统被恶意控制或文件泄露。API Token 消耗监控:复杂的研究类任务涉及多轮 Agent 思考、代码调试及高频信息检索,Token 消耗速度极快。建议为 API 账户设置配额上限,避免账单异常突增。硬件资源要求:部署节点内存需保持在 8GB 以上(考虑 Docker 沙盒负载);若面向生产环境或多人并发使用,建议使用 16GB+ 内存。版本迁移说明:DeerFlow 2.0 为全架构重构版本。注意旧版项目基于 1.x 架构,与 2.0 代码不兼容。建议在新分支独立部署 2.0,避免混合运行导致的不稳定性。
Unlimited-OCR
Unlimited-OCR 使用指南Unlimited-OCR 是百度(Baidu)开源的一款针对长文本/多页文档解析的端到端 OCR 大模型。该模型旨在推动“单次长序列文档解析”的技术发展,能够高效处理复杂的 PDF、报表及论文等结构化文件。一、平台与开源信息许可证协议采用 MIT 开源协议。允许免费商业使用及二次开发。获取地址GitHub:https://github.com/baidu/Unlimited-OCRHugging Face仓库名:baidu/Unlimited-OCR(可在 HuggingFace Pages 查看)演示空间ModelScope / HuggingFace Spaces 提供部署 Demo。二、主要功能特性单图高精识别能力支持对高分辨率复杂图像进行结构化识别。长上下文连续解析最高支持 32,768 tokens。可直接输入多张图片或自动将 PDF 转图后,一次性完成整份文档的解析输出。针对重复生成优化内置专门的 DeepseekOCRNoRepeatNGramLogitProcessor 逻辑处理。有效解决传统视觉语言模型在长文档识别中容易出现的内容循环、文本重复输出的问题。多推理引擎支持提供多种接入方式(Hugging Face Transformers, vLLM, SGLang)。包含 Docker 镜像与多线程并发处理脚本 infer.py。三、适用人群与场景AI 开发者 / 算法工程师需要处理复杂 PDF、电子报表或论文的团队,希望实现文档电子化与 Markdown 结构化抽取的技术人员。RAG / 知识库搭建者RAG(检索增强生成)系统的核心前置需求是长文本高效 Parsing,此模型能显著提升准确性。企业与科研机构寻找高精度、可私有化部署且无需支付高额授权费用的开源 OCR 解决方案的用户。四、免费与付费情况说明本地开源方案(推荐)MIT 协议,模型权重和代码完全免费。自建 GPU 节点部署无任何额外费用。云端托管服务现已上线百度智能云(千帆大模型平台)。如不想自行搭建环境,可使用其提供的 API 或托管算力服务。五、核心使用流程1. 基础 Python 依赖安装推荐环境:Python 3.12 + CUDA (建议版本 12.x/13.x)关键库列表:需包含 torch, transformers, Pillow 等常用深度学习及图像处理库。2. Python 代码推理示例(Hugging Face Transformers)此脚本使用 gundam 模式对单图进行切片增强解析,请确保替换为本地图片路径:pythonimport torch from transformers import AutoModel, AutoTokenizer model_name = 'baidu/Unlimited-OCR' # 1.加载 Tokenizer 和 Model (建议开启 safetensors) tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True) model = AutoModel.from_pretrained( model_name, trust_remote_code=True, use_safetensors=True, torch_dtype=torch.bfloat16 ).eval().cuda() # 2.执行单图解析 (使用 gundam 切片模式提升复杂排版识别率) model.infer( tokenizer=tokenizer, prompt='<image>document parsing.', # Prompt image_file='your_image.jpg', # 输入图片路径 output_path='./output', # 结果输出目录 base_size=1024, # Base Size (大图模式) image_size=640, # Image Resize (切片大小) crop_mode=True, # True=gundam模式,False=base模式 max_length=32768, # 最大输出 Token 数 save_results=True # 保存结果文件 ) import torch from transformers import AutoModel, AutoTokenizer model_name = 'baidu/Unlimited-OCR' # 1.加载 Tokenizer 和 Model (建议开启 safetensors) tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True) model = AutoModel.from_pretrained( model_name, trust_remote_code=True, use_safetensors=True, torch_dtype=torch.bfloat16 ).eval().cuda() # 2.执行单图解析 (使用 gundam 切片模式提升复杂排版识别率) model.infer( tokenizer=tokenizer, prompt='<image>document parsing.', # Prompt image_file='your_image.jpg', # 输入图片路径 output_path='./output', # 结果输出目录 base_size=1024, # Base Size (大图模式) image_size=640, # Image Resize (切片大小) crop_mode=True, # True=gundam模式,False=base模式 max_length=32768, # 最大输出 Token 数 save_results=True # 保存结果文件 ) 3. PDF 批量解析与命令行工具借助官方内置的 infer.py 脚本配合 SGLang 服务,可直接开启多线程并发处理:命令说明:解析整个 PDF 文件并指定输出目录。参数设置建议:PDF 连续解析通常建议使用 base 模式(对应代码中的 crop_mode=False)。运行示例:bash# python infer.py --pdf ./document.pdf \ # (请确认实际脚本文件名) --output_dir ./outputs \ # PDF 文件路径与结果输出目录映射 --concurrency 8 # GPU并发处理设置 --image_mode base # mode: gundam(单图/复杂), base (多页/PDF) # python infer.py --pdf ./document.pdf \ # (请确认实际脚本文件名) --output_dir ./outputs \ # PDF 文件路径与结果输出目录映射 --concurrency 8 # GPU并发处理设置 --image_mode base # mode: gundam(单图/复杂), base (多页/PDF) 六、注意事项与配置建议模式选择指南gundam 模式:适用于单图或排版复杂的图片(对应参数 image_size=640, crop_mode=True)。base 模式:适用于多图批量解析或 PDF 连续解析(通常不启用切片裁剪,图像尺寸较大如 1024)。硬件资源要求显存推荐:模型上下文长度高达 32k,建议在 NVIDIA A100, H100, RTX 4090 等算力充足的设备上运行。精度设置:强烈建议使用 torch.bfloat16 混合精度推理以节省显存并保证速度。防重复生成配置 (Repetition Penalty)长文本生成的循环问题需要通过参数抑制,避免模型“复读”。多页文档建议:设置较大的 ngram_window=1024(如适用)。普通单图/短文:可设为较小的窗口值以平衡生成流畅度与重复抑制。
Mirofish
MiroFish 使用指南一、平台介绍与核心功能MiroFish 是一款基于多智能体(Multi-Agent)技术的 AI 预测与推演引擎。它通过注入现实世界的“种子信息”,在数字沙盘中构建成千上万个具备独立人格和长期记忆的智能体,模拟其交互与社会演化以推演未来趋势。🌱 主要功能亮点📝 种子材料解析支持上传数据分析报告、政策草案、突发新闻甚至小说故事等素材。利用 GraphRAG(图谱检索增强)技术,自动构建底层知识图谱与记忆库。🤖 社会仿真模拟自动生成智能体的人设及实体关系网络。让大量智能体在数字世界中自由交互、协作或竞争进行推演。🕹️ 动态干预(上帝视角)在模拟过程中,用户可随时注入新变量或突发事件。精准观测群体行为涌现的连锁反应与蝴蝶效应。📊 多维报告与深度互动模拟结束后由 ReportAgent 自动解析并生成详尽预测报告。支持直接与数字世界中的任意智能体或报告助手进行对话交互。二、适用人群与应用场景MiroFish 适用于需要进行推演分析、内容创作及 AI 研究的各类角色:🏛️ 决策者与公关团队应用场景: 政策出台前的影响模拟、社会热点与突发舆情事件的演化推演。核心价值: 实现“零风险试错”,预判潜在舆论走向。💹 金融与时政分析师应用场景: 基于宏观金融信号或时政要闻数据,推演市场走势与趋势变化。核心价值: 辅助投资决策,识别系统性风险。🖋️ 内容创作者与编剧应用场景: 导入小说前序章节(如示例中的《红楼梦》前 80 回)。核心价值: AI 推演失传结局或生成新的脑洞故事线。👨💻 AI 开发者与研究员应用场景: 探索多智能体协同机制、群体智能涌现现象及社会仿真学实验。三、费用说明:开源免费 vs. 服务成本项目本身完全开放,但运行所需的算力或 API 消耗需按需付费。💰 软件授权状态: ✅ 完全开源免费模式: 允许直接获取源码本地部署或使用 Docker 容器化运行。⚠️ 第三方服务成本(必须配置)MiroFish 作为 AI 引擎,其核心能力依赖于外部大模型服务和记忆存储层四、快速上手:源码部署指南项目支持源码或 Docker 两种方式,推荐新手通过源码部署。请严格遵循以下步骤:📋 步骤一:配置环境变量这是最关键的初始化步骤。进入项目根目录后执行复制并重命名配置文件:bashcp .env.example .env cp .env.example .env 编辑 .env 文件并填入必要参数(如 LLM API Key):LLM_API_KEY: 阿里百炼或其他平台的 Token 密钥。ZEP_API_KEY: Zep Cloud 的记忆层接口密钥。🔧 步骤二:一键安装依赖环境要求: Node.js (v18+) | Python (3.11-3.12) | uv在根目录下执行以下命令,自动完成所有虚拟环境及前端/后端的依赖安装:bashnpm run setup:all npm run setup:all 注:该命令将同时处理 python 后端与 node 前端的依赖库。🚀 步骤三:启动服务并访问在根目录下执行以下启动命令,确保前后端同步运行:bashnpm run dev npm run dev 控制台提示成功后,打开浏览器访问沙盘界面: 👉 http://localhost:3000五、避坑指南初次部署与使用 MiroFish 时,请务必注意以下关键问题:⚡ Token 消耗预警现象: 智能体密集交互会导致 LLM Token 飞速耗尽。建议: 初次测试务必将模拟轮数控制在 40 轮以内。防止账户余额瞬间被刷空,后续可再逐步增加规模。🐍 Python 版本锁死现象: setup 命令或运行后端时直接报错。原因: 依赖库对版本极其敏感,不兼容过新或过旧版本。要求: 严格锁定在 Python >= 3.11 且 <= 3.12。❌ 避免使用 Python 3.10(太老)或 Python 3.13/3.14+(可能缺失依赖)。🐢 Docker 网络加速现象: docker compose up -d 时长时间卡在拉取镜像阶段。原因: 国内网络连接速度较慢。解决: 记得修改 .env.yml 或 docker-compose.yml,启用官方提供的Gitee/Mirrors 加速镜像地址。
Sync-in
Sync-in 使用指南一、平台介绍Sync-in (sync-in.com) 是一款开源自托管型私有文件同步与团队协作平台。它采用 AGPL-3.0 开源协议,核心设计思想是强调数据主权。用户可以自由决定将文件存储在自有服务器上,无需担心数据上传至第三方公有云。该平台的主要定位包括:替代方案:可作为 Nextcloud、企业网盘等商业软件的开源免费替代品;也适合有私有化部署需求的团队使用。跨平台支持:内置网页端访问、Windows/macOS/Linux 桌面客户端,以及命令行工具 (CLI)。核心安全理念:无数据追踪,无文件上传至第三方服务器。二、核心功能详解📂 多端文件同步三种模式:支持双向实时同步、仅客户端向服务器上传、仅从服务器下载;此外还支持定时同步策略(单向/双向)。高级管理:提供模拟预校验检查数据完整性,查看详细的同步日志。单台桌面客户端可同时连接多台 Sync-in 服务实例进行分片存储或灾备备份。🛡️ 协作空间 Spaces层级隔离:区分个人私有空间和团队/组织公共空间(如按部门、项目划分)。独立配额:不同团队可设置独立的存储空间额度与访问权限;支持文件锚定技术,确保同一份大文件不被重复占用物理存储。🔐 精细化共享权限用户分级:严格区分内部员工账号与普通外部访客账号。加密外链:生成的分享链接可设置有效期、访问密码;支持配置下载权限或只读模式,部分文件甚至开启“不可编辑”状态以防篡改。冲突保护:内置机制防止多人同时编辑导致的关键数据丢失(配合锁定功能)。📝 在线文档协同双引擎兼容:无缝集成 OnlyOffice 与 Collabora Online,提供 Office (Word, Excel) 及 ODF 格式文件的在线多人实时编辑体验。协作记录:支持文件评论功能、操作历史追溯,便于团队协作审核流程。🔒 安全与系统集成认证强化:集成双因素认证 (2FA/MFA)、LDAP/OIDC 单点登录;生成应用专用密码用于第三方工具接入。本地挂载:支持将文件直接映射到 WebDAV,轻松挂载为系统本地磁盘目录(Windows 资源管理器、macOS Finder)。检索能力:内置全文检索功能,并集成 OCR 技术以识别图片内文本;提供 CLI 脚本用于自动化同步任务。⚙️ 配套管理功能存储控制:支持设置用户或团队的存储空间配额限制(防止单用户占满)。日常运维:包含批量文件操作、标签分类管理、大文件分片上传机制以及活动通知推送。三、适用人群分析✅ 推荐使用场景 (适合)企业/机构合规部门:特别是律所、政府机关、教育机构及医疗单位,对数据隔离有严格要求,拒绝数据流出内网或公有云。技术极客/NAS 玩家:拥有群晖 Synology、威联通 QNAP 等硬件用户,希望自行搭建私有云替代商业网盘服务者。远程办公团队:具备本地机房服务器条件的外网/内外网安全文件交换需求团队。运维与开发者:需要编写脚本进行定时自动备份、CLI 自动化管理同步策略的人员。❌ 不推荐使用场景 (不适合)零基础设施用户:没有独立服务器、NAS 或云服务器资源,无法自行部署软件的用户。Docker 新手/小白:缺乏 Docker Compose 命令执行能力或不熟悉反向代理配置的用户。追求“开箱即用”的普通大众:仅想通过网页浏览即有公有云体验(类似百度网盘)且不愿维护系统的用户。注意:目前无官方提供的公有云托管服务,仅提供自托管方案。四、免费与付费方案说明🆓 基础代码 (完全开源)功能完整性:源代码永久免费开放。所有核心同步、在线文档协作、权限管理等功能均无任何阉割。部署成本:用户可自行在 Docker、NAS 或 VPS 上免费部署,仅消耗硬件资源(不限用户数、存储容量)。获取地址:源码托管于 GitHub (https://github.com/Sync-in/Sync-in)。💰 付费增值服务 (技术支持类)服务内容:仅提供企业级的官方技术支援团队对接服务。包含定制部署方案、合规性二次开发协助及专属维护工单支持。获取方式:无公开的标准订阅定价页面。如需采购技术支持,请直接通过官网底部 Support 联系方式咨询商务报价。五、快速使用步骤指南🟢 方式 1: 自托管部署(主流方案)此方法适用于拥有服务器/NAS 的用户。准备环境:确保主机系统运行 Docker 或准备好 Docker Compose 配置目录;安装 SSL 证书以启用 HTTPS(生产环境必须)。一键镜像拉取:执行官方提供的 Docker Compose up 命令,自动拉起后端服务、数据库及文件存储服务。初始化管理员:进入网页后台界面 (http://你的IP:端口),设置管理员账号并配置域名绑定;可选勾选启用 OnlyOffice/Collabora Online 编辑器容器(也可后续单独部署)。分配空间与权限:在管理端创建团队/个人 Spaces,并为成员设置存储配额。🔵 方式 2: 桌面客户端同步适合需要在本地电脑自动备份或离线访问数据的用户 (Windows/macOS/Linux)。下载软件:前往官网下载对应的 Windows、macOS 或 Linux .deb/.rpm/AppImage 安装包;也可在应用商店搜索 Syncthing-like 风格的管理器(注:Sync-in 客户端多为独立分发包,非套件)。配置连接信息:填入自建服务的域名/IP、管理员账号及密码进行设备授权验证。挂载文件夹:选择本地需要同步的特定文件夹;设置同步方向(如仅上传至云端或全量双向)并设定定时周期后启动后台服务。🟠 方式 3: 网页端在线协作适合无需下载客户端,直接使用浏览器访问的场景。登录入口:直接在浏览器访问自建域名 (https://你的域名) 即可登录;支持扫码或账号密码验证(需开启 HTTPS)。文件操作:上传文件、创建文件夹结构;右键点击目标文件或分享链接设置权限给成员/外部访客。在线编辑:对于 Office 文档,直接打开即进入编辑器界面,可邀请多人同时编辑或添加评论批注。🟣 方式 4: WebDAV 挂载本地磁盘适合希望在资源管理器中像操作本地文件一样管理云文件的用户 (Windows/macOS)。获取地址:在系统设置中生成 WebDAV 连接链接,格式通常为 https://你的域名/webdav。添加位置:Windows -> “网络”>“添加网络位置”,输入上述链接;macOS -> Finder > "Go" > Connect to Server (使用 AFP/FTP/SMB/WebDAV)。连接验证:在弹出的窗口中输入账号密码即可挂载,后续操作等同于本地硬盘。🟤 方式 5: CLI 命令行自动化适合 Linux/Server运维脚本化场景。获取工具:下载官方的 CLI Client 二进制文件或源码包;编译安装至服务器指定路径。绑定服务与脚本:配置连接密钥,编写定时同步脚(例如配合 cron 任务),用于在离线备份场景下将数据推送到主节点或进行归档操作。六、注意事项🌐 网络访问限制Sync-in 无国内官方云服务器。所有部署必须基于用户自有的硬件(NAS/云服务器)。若在国内公网使用,需完成域名备案及配置 HTTPS;否则内网环境虽稳定但外部无法访问。🛠️ 部署门槛说明必须具备 Docker/Kubernetes、反向代理 (Nginx)、SSL 证书管理能力等基础运维知识。无官方公有云试用。如果缺乏硬件资源,不建议尝试此方案。💸 编辑器额外成本OnlyOffice/Collabora Online 通常需独立安装或部署第三方实例(如使用社区版免费版)。若用于企业正式商用且对功能有严格要求,需注意商业授权许可费用;轻量级用户仅开启文件同步可忽略此项。⚠️ 双向冲突规则若两台设备同时修改同一文件并尝试保存双向模式,系统会生成“冲突副本”以防丢失数据。重要核心文件建议手动使用锁定功能防止编辑冲突。🔒 安全硬性要求WebDAV 访问和客户端登录强制依赖 HTTPS (TLS)。若未配置 SSL/HTTPS,WebDAV 连接与部分移动端同步可能失败或出现认证错误;生产环境必须开启双因素认证 (2FA/MFA)。📞 服务支持范围开源版仅提供社区论坛答疑。遇到复杂故障无官方技术人员远程协助修复(除非购买付费企业级技术支持包)。🍏 移动端体验短板目前没有官方独立的手机 App。手机端文件同步仅能依靠网页访问或第三方 WebDAV 客户端连接,操作便捷性相对较弱。💾 数据备份责任Sync-in 不提供云端冗余存储功能。所有数据存储在用户自有的物理硬盘上。请务必自行配置 RAID、快照或多节点异地备份策略以防范硬件故障导致的数据丢失风险。
Netalertx
NetAlertX(PiAlert)核心干货整理指南📋 一、平台介绍NetAlertX 是一款开源、免费且自主托管的 网络资产发现与入侵检测系统。它被誉为局域网内的 “数字哨兵”,利用各种底层扫描协议持续监控网络环境。其核心价值在于帮助用户第一时间发现未知设备(如蹭网者或潜在入侵硬件)。✨ 核心定义架构类型:自托管开源软件 (Self-Hosted)主要用途:资产管理、安全检测、异常报警工作模式:持续监控局域网设备的在线状态、IP 变动及端口暴露情况。🛠️ 二、核心功能详解1. 持续扫描与资产发现系统支持定期或实时对局域网进行深度扫描,自动构建并维护设备清单。支持的底层协议包括:ARP 扫描ICMP / PINGDHCP 租约监测Nmap 端口探测2. 变更与异常警报机制当网络环境出现以下变动时触发即时警报:⚠️ 新设备接入(未知硬件上线)📴 设备离线(关键服务中断)🔄 IP/MAC 漂移(地址冲突或 MAC 伪造)3. 80+ 种通知通道集成通过内置的 Apprise 代理,支持向以下主流渠道推送警报消息:Telegram、Slack、Pushover、Discord、电子邮件、Webhooks 及其他自定义服务。4. 多网络与 VLAN 监控利用 Sync 插件(同步节点)功能,可实现跨子网管理:支持多个子网 / VLAN 联动适合远程分支机构资产汇总5. 智能家居集成原生支持通过 MQTT 协议完美对接 Home Assistant:可将设备在线状态直接转化为自动化触发条件(如“检测到新设备 -> 记录日志”)。🎯 三、适用人群与场景角色典型需求NetAlertX 价值点Homelab 玩家掌控家中 NAS、软路由状态7x24 小时监控设备健康度,防止智能家居离线IT/中小企业 (SOHO)办公室局域网安全监测低成本防御非法接入(影子 IT),无需购买商业 IDS网络安全爱好者漏洞管理与资产测绘扫描暴露端口,快速发现潜在的网络攻击面变化💰 四、开源与授权说明📜 许可协议完全免费且开源:遵循 GPL-3.0 协议。商业性:无官方付费计划。所有核心功能、插件及通知通道均本地化运行,无需云端账户或订阅费。🔗 相关资源链接🌐 官方网站/文档https://netalertx.com💾 GitHub 开源仓库https://github.com/netalertx/NetAlertX🚀 五、快速部署指南 (Docker Compose)官方推荐通过 docker-compose.yml 配置一键拉起。请严格按照以下步骤操作:✅ 第一步:准备配置文件创建目录:在宿主机上新建一个文件夹(例如 /opt/netalertx/)。写入文件:在该目录下创建名为 docker-compose.yml 的文件,并填入以下核心配置内容:yamlservices: netalertx: image: netalertx/netalertx:latest container_name: netalertx network_mode: "host" # 【关键】必须使用 host 模式以获取网络底层权限 restart: unless-stopped volumes: - ./config:/app/config # 配置文件映射 (Web UI、扫描设置) - ./db:/app/db # 数据库文件映射 (SQLite/SQL) environment: - TZ=Asia/Shanghai # 【建议】根据您的时区修改此选项 services: netalertx: image: netalertx/netalertx:latest container_name: netalertx network_mode: "host" # 【关键】必须使用 host 模式以获取网络底层权限 restart: unless-stopped volumes: - ./config:/app/config # 配置文件映射 (Web UI、扫描设置) - ./db:/app/db # 数据库文件映射 (SQLite/SQL) environment: - TZ=Asia/Shanghai # 【建议】根据您的时区修改此选项 ✅ 第二步:启动容器服务进入目录:通过终端切换至配置文件所在目录。执行命令:输入以下指令后台运行服务:bashdocker compose up -d docker compose up -d ✅ 第三步:登录与初始化设置访问控制台:在浏览器地址栏输入 http://<您的设备 IP>:20211。配置扫描范围:进入后台后点击左侧菜单的 Settings (设置),务必添加您要监控的子网(例如 192.168.1.0/24)。⚠️ 六、部署注意事项与避坑指南在初次使用或配置时,请务必关注以下风险点:🌐 网络模式限制强制 Host 模式:建议始终部署为 network_mode: "host"。❌ Bridge 模式的后果:容器无法直接抓取局域网 ARP 广播包,导致 Nmap/ARP 扫描器失效,仅能发现映射在 Docker 网段内的设备。🔒 安全防护与隐私严禁公网裸奔:默认 Web UI 未开启密码保护。请勿将端口(20211)直接暴露在 WAN 口。✅ 正确做法:配置反向代理(如 Nginx Proxy Manager)并启用 Basic Auth 或 Let's Encrypt HTTPS 证书。📢 通知免打扰机制“新设备”洪水问题:首次启动时,系统会将现有已知设备识别为“新接入”,导致触发海量骚扰通知。✅ 正确做法:先关闭所有通知通道。待扫描运行完毕、将所有正常设备在后台标记为 "Trusted (已信任)" 后,再重新开启通知功能。
cobalt
cobalt.tools 使用指南📖 一、平台介绍核心定位:开源免费无广告的网页媒体解析下载工具。基于 AGPL-3.0 协议开源(Github:imputnet/cobalt),主打隐私保护与用户体验。零追踪/日志: 服务器不存储任何用户请求数据,本地优先转码。无需登录: 粘贴链接一键下载公开视频、音频、图片及 GIF。安全无忧: 强制加密隧道(运营商无法识别),无捆绑广告或木马弹窗。多平台支持:涵盖 Bilibili、YouTube、TikTok、抖音、X (Twitter)、Instagram、Reddit、SoundCloud、Vimeo、 Twitch片段等 30+ 主流媒体站点,并支持自建私有实例。🎥 二、主要功能详解1. 多规格媒体下载视频:最高画质: 支持 8K/HDR/144fps。格式选择: MP4 / WebM / MKV,分辨率可选(144p ~ 8K)。编码选项: AV1、H264、VP9 等多种硬解兼容模式。音频提取:单独剥离 MP3 音轨,适配短视频 BGM、播客及音乐下载。图片/GIF/图集:支持推文循环视频转 GIF、TikTok 长图采集等。部分站点(抖音/TikTok)提供去水印版本原图下载。2. 隐私安全机制零日志策略: 服务器端无用户历史记录,保护个人浏览痕迹。加密传输: 强制使用 TLS 加密隧道,防止运营商干扰或监控下载源。本地转码优先:大部分处理直接在浏览器环境完成(基于 WebAssembly),不走公共存储逻辑。3. 高度自定义设置预设方案: 快速切换画质、容器格式、音频质量开关。高级控制: 长视频分段下载策略、GIF 转换开关开启/关闭等。节点管理:支持多实例切换(官方主站 vs 自建私有解析节点)。4. 配套能力与技术生态API 开放: 提供标准接口,可接入第三方工具或开发自定义前端页面。便捷交互:全键盘快捷键操作(无需鼠标点击输入框:Ctrl+V / Shift+D)。完美适配移动端浏览器,无客户端安装依赖。5. 高阶开发者功能(技术向)一键部署: Docker Compose/Dockerfile 脚本支持私有化搭建。运维配置: 可自定义限流策略、时长限制规则及本地存储清洗策略。👥 三、适用人群与场景指引✅ 适合使用的人群普通用户:临时保存短视频缓存、下载网课资料或播客收听,不想安装臃肿客户端。自媒体创作者/剪辑师:提取无水印素材音频扒取、收集离线剪辑用公开视频片段。学生与研究者:存档公开教学课程(MOOC)、公开课资源以备复习查阅。技术爱好者:搭建私有解析节点,学习二次开发 API 接口或部署开源项目。⚠️ 不适合使用的人群/场景批量下载需求者:平台目前无自动播放列表抓取功能。不支持完整合集的连续批量打包(仅支持单视频处理)。DRM 加密内容破解:无法解析付费会员专享、私密/仅好友可见内容及高防 DRM 流媒体。专业级素材需求者:GIF 转码体积往往巨大,长视频不建议强转为 GIF。超高码率无损原始素材(部分老旧播放器对 AV1/VP9 支持不佳)。💰 四、免费与付费情况说明📌 官方主站永久免费cobalt.tools 核心服务目前为 100% 永久开源免费。✅ 无会员等级区分。✅ 不限下载总次数/频率(受限于带宽限流策略)。❌ 无任何隐藏付费墙或广告诱导。资金维持: 项目依靠社区成员捐赠运行,界面内不设强制打赏入口。💸 关于“收费”的两种情况说明若遇到需缴费场景,请务必甄别:第三方托管服务:部分服务商(非官方)自建解析实例并收取服务费。此类无统一定价页面,建议按需使用或寻找免费开源方案替代。企业私有部署成本:若选择自行搭建服务器用于内部/团队使用,需自行承担云服务器硬件及带宽费用,平台本身不产生软件授权费。🛠️ 五、极简使用步骤访问官网:在浏览器输入 https://cobalt.tools。获取链接:复制任意公开媒体的分享网页地址(支持 .mp4, .gif 等)。粘贴解析:打开输入框,按 Ctrl+V (Win) / Command+V (Mac) 或使用页面快捷键快速提交。⚙️ 底部设置栏可选:仅提取音频(MP3);自定义画质与分辨率;开启加密隧道模式;GIF 转换开关。点击下载:确认参数后点击按钮,浏览器将直接获取文件流进行下载或在线播放预览。(进阶) 自建节点: 技术人员可在设置页填入自定义 API Key 或域名切换至私有实例服务。⚠️ 六、注意事项与避坑指南🌐 1. 网络访问提示国内直连问题:海外官方主站在国内服务器加载可能缓慢,解析超时率较高。Bilibili / 抖音等国内站点链接相对稳定,建议优先测试此类资源。YouTube/TikTok 类国际内容极易出现无法解析的情况(源域名屏蔽)。解决方案: 若主站不稳定且为刚需用户,建议在 Docker/虚拟机内自建私有实例节点解决网络路由问题。📵 2. 功能硬性限制仅限公开资源:私密视频、仅好友可见的动态、DRM 加密片源一律无法解析。无字幕支持:平台不提供外挂字幕文件的自动下载与同步。超长文件处理:极长视频可能会触发分段输出,或限制单文件大小(保护带宽),非完整打包模式。⚖️ 3. 版权合规警告个人用途原则:平台仅适用于离线学习/收藏等个人行为。🛑 严禁商用二次分发。用户需自行评估内容版权归属与侵权责任。❌ 禁止用于传播盗版影视作品、付费音乐或破解版权保护机制。🔒 4. 隐私与安全认准官方域名:仅信任 cobalt.tools。警惕仿站(如 cobalt-tools.com, cobalttools.online),仿建站通常存在广告追踪甚至木马风险。自建实例鉴权:API 密钥、自托管节点严禁公网裸跑,务必配置反向代理及访问令牌进行鉴权保护。公共限流策略:官方公共实例存在防刷机制,短时间高频批量请求会触发封禁(IP/Session),请保持适度使用频率。📱 5. 设备与兼容性建议浏览器选择:优先推荐 Chrome / Firefox 桌面端环境(长视频转码性能更强)。移动端可用,但注意转码耗时较长,体验可能不如电脑流畅。播放器适配:AV1/VP9 编码在部分老旧手机或电视上可能无法播放,建议在设置中切换至 H.264 (MP4) 格式以保证最大兼容性。🐳 6. 自托管部署风险(Docker)依赖环境:需提前安装配置好 Python3、yt-dlp、FFmpeg 等二进制文件,否则极易导致解析报错。建议拉取官方 Docker Compose 示例进行一键初始化以减少手动排错成本。带宽瓶颈:自建服务器若上行/下行带宽不足(如小 VPS),大文件下载会出现断流或速度极慢现象,请根据业务量评估硬件资源。
CodeWiki
CodeWiki 使用指南简介:CodeWiki 是由 FPT Software AI Center(FSoft-AI4Code)开发并发表于 ACL 2026 的开源工具。它专门用于解决“大模型难以理解整个代码仓库”的问题,能够自动将庞大、多语言的代码仓库梳理成结构清晰、架构完备的 Wiki 文档。📖 平台介绍与核心定位传统的 AI 助手往往只能理解单个函数或文件,缺乏全局视野。CodeWiki 采用“自顶向下”的层次分解和多智能体(Multi-agent)递归生成机制:系统级理解:将复杂的代码仓库剥离成模块、组件。依赖梳理:分析跨文件、跨模块的系统交互与数据流关系。架构图生成功能:像人类架构师一样,最终生成包含 Mermaid 架构图的完整 Wiki 文档体系。✨ 核心功能亮点🔍 仓库级架构理解 (Repository-Level)不仅限于解释单个文件,工具能够梳理跨文件的模块交互、数据流以及系统级的依赖关系,真正掌握代码全局逻辑。🖼️ 多模态文档合成 (Multi-Modal Synthesis)自动配图:结合文字描述自动生成架构图(Mermaid)、数据流图和序列图。智能校验:集成 Mermaid 工具链确保生成的图示可直接渲染且语法正确可用。🧠 递归智能体生成机制 (Recursive Agents)能够根据模块的复杂程度,动态分配 LLM 任务给多个智能体协作完成,确保即便是百万行级别的庞大项目,文档细节质量依然不滑坡(Scale without Sliding Quality)。🌐 多语言原生支持无需二次配置即可解析主流后端与前端代码:编程语言:Python, Java, JavaScript/TypeScript, C/C++, C#等。生态兼容:同时处理脚本、配置文件及测试文件,全面覆盖技术栈。👥 适用人群与建议场景目标角色典型应用场景开源项目维护者快速为项目构建高质量官方 Readme / Wiki,降低社区文档门槛。新入职/接手项目的研发人员一键分析历史遗留系统(“屎山”代码),通过生成架构图迅速摸清业务逻辑与结构。技术主管/架构师快速生成系统交互、调用关系图谱,用于复盘系统健康度及依赖风险复核。💰 费用模式说明 (免费 & 开源)软件本身:完全免费。基于 GitHub 开源协议发布,无平台订阅费或商业授权限制。运行成本:按需付费 (Token 消耗)。工具作为本地 CLI 命令行版本运行(无需 SaaS 托管),生成文档时需调用外部大模型 API(如 Anthropic Claude、OpenAI)。您只需支付 LLM 厂商的 Token 费用,无其他隐形消费。🚀 快速上手指南 (极简版)1️⃣ 准备环境确保本地已安装以下基础运行库:Python: 3.12 或更高版本 (pip)。Node.js:用于校验 Mermaid 架构图的渲染与语法(可选但推荐)。2️⃣ 一键安装 (PyPI / Git)直接在终端中执行以下命令获取最新源码安装包:bash# 从 GitHub 主仓库安装最新版代码库 pip install git+https://github.com/FSoft-AI4Code/CodeWiki.git # 验证安装是否成功 codewiki --version # 从 GitHub 主仓库安装最新版代码库 pip install git+https://github.com/FSoft-AI4Code/CodeWiki.git # 验证安装是否成功 codewiki --version 3️⃣ 配置 LLM API (以 Claude 为例)设置您的模型连接与凭证,支持 Anthropic、OpenAI 等主流接口:bash# 1. 填入 Key, Base URL, Model Name (如 claude-sonnet-4) codewiki config set \ --api-key YOUR_API_KEY \ --base-url https://api.anthropic.com \ --main-model claude-sonnet-4 \ --cluster-model claude-sonnet-4 # 2. 配置验证 (检查状态与连通性) codewiki config show codewiki config validate # 1. 填入 Key, Base URL, Model Name (如 claude-sonnet-4) codewiki config set \ --api-key YOUR_API_KEY \ --base-url https://api.anthropic.com \ --main-model claude-sonnet-4 \ --cluster-model claude-sonnet-4 # 2. 配置验证 (检查状态与连通性) codewiki config show codewiki config validate 4️⃣ 生成文档进入项目根目录,执行核心命令:场景 A:在本地生成标准 Markdown Wiki(默认存入 ./docs/)bashcd /path/to/your/project codewiki generate cd /path/to/your/project codewiki generate 场景 B:生成适用于 GitHub Pages 的 HTML 预览版链接bashcodewiki generate --github-pages codewiki generate --github-pages ⚠️ 注意事项与避坑指南Token 消耗预算对中大型项目(如数十万行代码)进行全局深度分析会产生巨量 Token。💡 建议策略:首次使用时,先用小型测试项目试运行。估算单次生成的费用后,再决定是否对超大规模仓库进行分析。网络与代理设置由于工具需调用外部 API(LLM),请确保本地终端的网络或公司出口代理通畅。❌ 常见报错:API 连接超时、中断或服务不可用通常源于防火墙拦截或缺失的 Proxy 环境配置。Mermaid 依赖检查生成的文档包含大量流程图。若 Node.js 版本过低或未安装相关校验脚本,可能会导致 Mermaid 语法图无法渲染或报错。请确保满足最低运行要求后再生成大文件。
OpenMontage
OpenMontage 使用指南:全球首个开源 Agent 驱动视频制作系统GitHub 上备受关注的开源 AI 项目,不仅是“文生视频”,更是智能体(Agent)驱动的完整全流程制作系统。📖 1. 平台介绍:重新定义视频工作流传统的 AI 视频工具通常只能生成单一的小段画面,而 OpenMontage 的核心逻辑截然不同:✅ 核心理念: 将你的 AI 编程助手(如 Claude Code, Cursor, GitHub Copilot, Windsurf)直接转变为全功能的视频制作工作室。💡 工作原理: 你只需输入自然语言需求,AI Agent 会自动拆解任务,调用内置的12 条生产管线、52 种工具及500+ 智能体技能。流程涵盖从选题调研、剧本撰写、素材搜集/生成、语音合成到后期剪辑与最终合成的全过程。⚙️ 2. 核心功能详解OpenMontage 并非简单的生成器,而是提供了一套完整的工业级视频生产管线:🎬 12 条专业视频制作管线支持多种复杂场景的视频产出,包括但不限于:科普讲解类:适合知识博主与教学演示。电影感短片 / Pixar 风格动画:高水准的创意叙事。纪录片 / 播客:真人出镜或语音驱动的深度内容。屏幕演示 / 数字人分身:高效的产品功能介绍与企业宣传。🔄 视频逆向工程(Start From A Video)无需从头开始创作,直接粘贴一个 YouTube、TikTok 链接或上传本地视频即可:Agent 自动分析原视频的剧本结构、文案节奏与视觉风格。在保留优秀框架的前提下,为你重新定制一套关于新主题的生产方案。🖼️ Backlot 实时可视化故事板制作过程中内置的可视化大屏功能:实时监控: 展示当前剧本、镜头卡片及正在生成的素材进度。接触表(Contact Sheet)预生成: 在高成本素材正式渲染前,先生成缩略图预览供人工审批与调整,有效防止预算浪费。🔍 真视频检索与合成解决“画面静止”的问题:Agent 可自动从 Archive.org、NASA、Wikimedia 及 Pexels 等免费公有库中检索真实的运动剪辑(Motion clips)。在本地 Remotion 框架中进行拼接,保证视频的动态质感。📊 动态数据排版(Data Explainer)无需生成图片即可制作高质量视频:Agent 自动生成平滑的动态统计图表与可视化动画。适用于展示纯数据驱动的内容或报告类短视频。👥 3. 适用人群定位无论你是技术极客还是内容创作者,都能在 OpenMontage 找到使用场景:身份核心需求与价值开发者 / 程序员习惯 Cursor 等 AI 编程工具,希望通过代码级工作流高效率、成批地生产视频。独立开发者 / 创业者低成本为自己的 SaaS 产品制作功能演示(Demo)或宣发广告视频。自媒体创作者 / 博主快速批量化制作科普知识、历史故事、每日事实等中短视频内容。AI 工作流研究者想要探索多 Agent 协同(Agentic Media Production)在多媒体领域实际落地的技术爱好者。💰 4. 免费付费情况与定价模式OpenMontage 坚持开源原则,同时提供灵活的 API 计费支持:✅ 零成本运行路径如果不配置任何收费的高级 API,系统会自动切换到本地免费方案(Hard Cap Mode):配音: 使用本地运行的 Piper TTS(完全免费)。素材: 从 Pexels、Archive.org 等抓取免费公有素材。渲染: 依靠本地的 FFmpeg 进行视频合成。成本: 资金成本为 $0。⚙️ 高级功能 API 费用(按量付费)如果你需要追求好莱坞级别的质感,可配置第三方 API:生成质量示例:Ghibli 风格动漫视频(含 12 张 FLUX 绘图及镜头动效)约需 $0.15。Pixar 风格的 3D 动画短片成本仅需约 $1.33 左右。费用参考页面:https://fal.ai/pricing基础大语言模型:https://openai.com/api/pricing/高级逻辑推理:https://www.anthropic.com/pricing📌 提示: OpenMontage 本身是自托管开源工具,不设自有商业定价。API 花费仅取决于你选择的底层大模型或生成服务商标准。建议务必在配置文件中设置预算上限(见注意事项)。⚡️ 5. 快速使用指南:从零开始制作视频🛠️ 前提准备环境: 安装 Python 3.10+ 及 Node.js 18+(推荐 Node v22+ 以支持高级渲染)。依赖: 本地安装并配置好系统环境变量 FFmpeg。权限: AI 编程助手需拥有执行 CLI 命令、读取文件系统的权限。🚀 操作步骤克隆仓库bashgit clone https://github.com/calesthio/OpenMontage.git cd OpenMontage git clone https://github.com/calesthio/OpenMontage.git cd OpenMontage 一键环境配置 在终端中运行以下命令初始化项目:bashmake setup make setup 若脚本报错,请手动安装依赖 pip install -r requirements.txt,并进入 remotion-composer 目录执行 npm install。配置本地配音(可选) 如果需要免费 TTS:bashpip install piper-tts pip install piper-tts 初始化 API 密钥复制环境变量模板文件:bashcp .env.example .env cp .env.example .env 在生成的 .env 文件中填入你的 OpenAI、Claude 或 Google Gemini API 密钥。建议开启预算限制(Budget Caps)。开始制作视频 打开你的 Cursor、VS Code + Copilot 或其他 AI Agent,直接输入自然语言指令:“帮我制作一个关于‘量子计算如何工作’的科普讲解视频”时长:60 秒风格:使用免费本地配音加 Remotion 渲染*⚠️ 6. 关键注意事项与避坑指南为了确保生产安全,请务必关注以下细节:权限授予问题 AI Agent(如 Cursor/Claude Code)必须被授予执行本地命令的权限。特别是在 Linux/Mac 上运行 npm 和 python 时需要 sudo 或特定系统配置支持。Windows 用户特别注意: 若 npm install 报错 ERR_INVALID_ARG_TYPE,请在 remotion-composer 目录下使用 npx --yes npm install 强制安装。硬性预算帽(Hard Spend Caps)💣 高危提示:Agent 在尝试优化视频时可能会调用昂贵的 API。强烈建议在进入 .env 或 config.yaml 配置中设置单次运行的最大 API 费用限制,防止因 Agent 过度试错导致意外的大额账单。Windows 兼容性问题 Windows 环境在某些情况下可能存在库路径问题。如果遇到渲染失败,请尝试安装最新版本的 Node.js(推荐 v20+ 或更高)并更新 FFmpeg。
OpenCut
OpenCut 使用指南OpenCut (opencut.app) 是一款主打 开源、隐私安全且完全免费 的跨平台视频剪辑工具。它被广泛称为 "CapCut (剪映) 的开源替代方案”,致力于在本地浏览器或设备上提供无水印、无订阅限制的流畅剪辑体验。📍 1. 项目定位与技术背景核心定位:隐私优先的轻量级视频编辑器,无需上传云端素材即可创作。技术架构演变:最初基于 TypeScript/Next.js 构建;目前正在进行全面重构(从 TypeScript 迁移至 Rust 核心),以追求极致性能和插件化生态扩展能力。数据处理原则:全本地化处理。所有视频处理、渲染均在用户设备端完成,数据不上传任何云端服务器。开源地址:https://github.com/opencut-app/opencut(目前拥有数万 Star)。🛠️ 2. 核心功能特性💻 基础剪辑能力多轨道时间轴编辑:支持视频、音频、文字等多素材分轨剪辑、裁剪、拼接及实时预览。专业工具集:提供实用的吸附功能(Snapping)、波纹编辑(Ripple Edits)及完整的快捷键支持系统。无水印导出:最终成品可直接保存为本地文件,无任何平台 Logo 或广告干扰。🚀 进阶与生态发展(重构中)编辑器 API:开放接口以便第三方扩展和定制。插件系统:正在建设中,支持功能模块化扩展。MCP 服务端集成:支持与 AI 智能体(Agent)对接。无头批量渲染:自动化、批量化视频处理模式。👥 3. 适用人群画像用户类型需求场景推荐原因短视频创作者制作 YouTube Shorts、TikTok 等内容;追求快速出片,反感 VIP 限制或水印。免费无门槛,效率媲美商业软件基础版。隐私敏感用户不愿将个人素材上传至任何第三方云端服务器。本地运行,数据自主掌控,100% 隐私安全。开发者与极客需要自行修改源码、搭建私有化服务或通过 API 实现自动化。MIT 开源协议,代码完全开放可二次开发。💰 4. 费用模式与免责声明(重要)✅ 官方版本:100% 免费定价:无任何付费门槛。限制说明:无订阅费、无隐藏付费功能解锁、无广告干扰。协议支持:基于宽松的 MIT 开源协议,允许商业化和修改使用。⚠️ 警惕“同名混淆”产品(非官方)注意区分以下情况: App Store 上存在由第三方开发者上架的付费软件,名称可能包含 "OpenCut"、提供 AI 翻译/配音等功能。这与开源项目完全无关。本文介绍的 opencut.app:是纯粹的开源社区项目。无定价页面:因为它是免费的且支持本地部署,不存在官方售卖的商业版本。📂 5. 使用指南🖥️ 方式 A:网页版直接使用(无需安装)适合大多数普通用户快速开始剪辑:访问官方网站 opencut.app。导入素材:直接将本地视频或音频文件拖拽至媒体池。时间轴编辑:在轨道上排列、添加文本、滤镜及转场。导出下载:点击右上角生成无水印高清成品并保存到电脑/手机。💻 方式 B:本地部署 / 开发者自建适合想要离线运行或进行二次开发的场景,需准备 Bun 环境:bash# 1️⃣ 克隆仓库至本地 (假设已安装 Git) git clone https://github.com/OpenCut-app/OpenCut.git cd OpenCut # 2️⃣ 使用 Bun 快速依赖管理与启动 bun install moon run web:dev # 1️⃣ 克隆仓库至本地 (假设已安装 Git) git clone https://github.com/OpenCut-app/OpenCut.git cd OpenCut # 2️⃣ 使用 Bun 快速依赖管理与启动 bun install moon run web:dev ⚠️ 6. 注意事项与性能说明重构过渡期:由于正在进行从 TypeScript 到 Rust 的大规模底层重构,部分高级功能或新版预览入口(如 new.opencut.app)可能存在偶尔不稳定的情况。如遇 Bug,建议使用经典版或在 GitHub Issues 提交反馈。硬件性能依赖:该工具利用浏览器本地计算资源进行渲染。剪辑超大文件或高码率视频时,建议 CPU/内存配置较高的 PC/Mac,否则可能出现卡顿或预览加载慢的情况。素材库现状:相比商业软件(如剪映),官方自带滤镜、特效库及商用音乐包较少。目前它更适合专注于 “纯剪辑流程” 的创作者,若需海量素材可自行导入第三方资源。
OpenConnector
OpenConnector 使用指南一、平台介绍OpenConnector 是一款开源的 AI Agent 连接器网关,可视为 Composio 的优秀替代方案。其核心特性如下:海量连接能力:一次绑定第三方账号,即可给 Agent 开放超过 1000+ 服务商、10000+ 预置工具动作。凭据安全隔离:敏感凭证加密存储于网关内部,不直接暴露给 Agent 进程。生态兼容性强:开源版与 OOMOL 商业 SaaS 共用一套动作契约(Schema),支持本地/云端多部署模式。二、核心功能详解1. 海量连接器库覆盖主流开发平台及工具,例如 GitHub、Gmail、Notion、Slack、Airtable、BigQuery 等;完整支持以下三类服务商接入方式:API Key 授权OAuth2 标准认证免鉴权服务2. 多接入通道提供多样化的集成接口与客户端,适配不同使用场景:SDK (TS):轻量级 TypeScript 客户端,完美适配自托管或 OOMOL 托管环境。oo CLI:命令行工具,供本地 Agent 直接调用中继服务。MCP:原生对接 MCP(Model Context Protocol)标准 Agent 宿主。HTTP / OpenAPI:提供标准的 /v1/actions 接口文档,支持直接发起 HTTP 请求调用动作。3. 安全运行管控内置企业级安全防护机制,包括凭据加密存储、权限 Scope 隔离、运行时 Token 管理以及日志脱敏处理等策略;同时具备临时文件中转站功能。4. 可视化控制台提供本地 Web 面板(默认端口 http://localhost:3000),支持以下操作:服务商管理与凭据配置实时监控运行时的 Token 状态动作调试与调用统计查询失败记录追踪与分析5. 多部署方案灵活适配不同资源环境,无需被云厂商绑定:本地模式:Docker / Node.js 直接安装。云原生模式:Fly.io、Cloudflare Workers (配合 D1/R2)。托管服务:直接使用 OOMOL Runtime 托管平台。6. 配套桌面端 Wanta拥有独立连接器库,无需部署网关服务器即可使用。支持自然语言驱动跨工具操作,开箱即用体验好。三、适用人群与场景个人 / 独立开发者:构建本地 Agent 或 AI 工具开发时,不希望将第三方密钥直接交给 Agent 进程处理。AI 产品团队:需要给自家大模型应用快速打通各类 SaaS 平台,统一鉴权层,并支持私有化部署需求。创业 / 中小企业:缺乏自研连接器开发成本预算,需快速接入 OAuth 服务的场景。隐私敏感型组织:团队有严格合规要求,必须将第三方凭据保留在自有服务器内(自托管)。MCP 生态使用者:希望利用标准化协议打通各类线上工具赋能本地 Agent 的团队或个人。四、免费 & 付费模式说明💰 方案 A:开源自托管 (永久免费)授权许可:Apache 2.0,无功能阉割版源码开放。包含内容:全部连接器库、动作接口、Web 控制台、SDK/MCP/HTTP 能力均完全解锁。成本构成:仅需承担服务器及云资源费用,无任何软件授权费。💳 方案 B:OOMOL 托管商业 SaaS (按需付费)核心价值:免除自建运维压力(无需维护数据库、SSL、Node),提供现成 OAuth 鉴权通道以加速产品上线。迁移优势:与开源版接口完全兼容,后期可随时平滑迁移至私有化部署。团队协作:配套 Wanta 桌面端使用托管服务时,支持团队多人共享连接权限。咨询方式:官方文档暂无独立定价 URL,建议直接联系 OOMOL 官网客服获取报价。📊 成本总结对比维度自托管 (开源)商业托管 (SaaS)适用对象个人 / 技术团队 / 有运维能力的企业无运维团队 / 追求快速上线的产品组软件费用零元(仅硬件成本)付费订阅/按量注:自托管意味着您需要自行维护服务器环境;若使用 Cloudflare 免费版需注意其调用和存储限额,重度场景建议扩容。五、快速上手步骤指南🚀 方式 1:Docker 本地启动 (新手推荐)适用于大多数个人开发者和测试环境。Step 1: 拉取镜像并启动bash# 简单启动(使用默认配置文件) docker compose up # 若需源码构建,请使用以下命令 docker compose -f docker-compose.yml -f docker-compose.build.yml up --build # 简单启动(使用默认配置文件) docker compose up # 若需源码构建,请使用以下命令 docker compose -f docker-compose.yml -f docker-compose.build.yml up --build Step 2: 访问控制台与文档Web 面板:http://localhost:3000API 文档:http://localhost:3000/docsStep 3: 测试无鉴权动作 (以 HackerNews 为例)bashcurl -s -X POST http://localhost:3000/v1/actions/hackernews.get_top_stories \ -H 'content-type: application/json' \ -d '{"input":{}}' curl -s -X POST http://localhost:3000/v1/actions/hackernews.get_top_stories \ -H 'content-type: application/json' \ -d '{"input":{}}' Step 4: 绑定服务商 (以 GitHub API Key 为例) 请先准备好您的 GitHub Personal Access Token。bashcurl -s -X PUT http://localhost:3000/api/connections/github \ -H 'content-type: application/json' \ -d '{"authType":"api_key","values":{"apiKey":"你的GitHub PAT"}}' curl -s -X PUT http://localhost:3000/api/connections/github \ -H 'content-type: application/json' \ -d '{"authType":"api_key","values":{"apiKey":"你的GitHub PAT"}}' Step 5: 调用已绑定的工具动作 (获取当前用户信息)bashcurl -s -X POST http://localhost:3000/v1/actions/github.get_current_user \ -H 'content-type: application/json' \ -d '{"input":{}}' curl -s -X POST http://localhost:3000/v1/actions/github.get_current_user \ -H 'content-type: application/json' \ -d '{"input":{}}' ☁️ 方式 2:云端部署方案Cloudflare Workers:通过 Wrangler 配置 + D1 数据库迁移,执行 npm run deploy:cloudflare。Fly.io:基于 Docker 镜像推送至平台并绑定持久化 SQLite 卷即可运行。OOMOL 托管服务:直接在注册平台获取 API Key,无需运维服务器节点。💻 方式 3:无代码体验 Wanta (桌面端)下载 Wanta 桌面客户端。登录 OOMOL 官方账号并绑定各类 SaaS(如 Slack, Notion)。直接开始操作:无需部署网关,通过自然语言指令跨工具进行任务管理。六、注意事项与避坑指南在开发过程中请重点关注以下风险点与建议:🔒 1. 安全风险管控凭据隔离原则:API Key 及 OAuth 密钥仅存储于 Runtime 内部,严禁前端代码或 Agent 直接持有原始服务商凭据。生产环境限制:必须配置 Action 黑白名单策略,严格限制高危操作(如删除文件、退款等)。开发规范:禁止将密钥硬编码在代码仓库中提交至 Git,务必使用环境变量管理。💸 2. 部署与成本考量运维责任:选择自托管模式需自行解决数据库维护、SSL 证书更新及系统升级问题。云资源限制:若选 Cloudflare 免费版搭建,请注意其免费配额;超出部分必须付费扩容。📜 3. 品牌与合规标识使用:内置服务商的 Logo 和名称仅用于识别功能用途,不代表官方授权。若在商用产品展示中使用相关商标,请务必查阅第三方协议合规性。日志脱敏:务必开启日志脱敏配置(Masking),避免明文留存用户隐私数据,以满足 GDPR/个人信息保护法等要求。🌐 4. 网络与环境限制跨境鉴权延迟:部分海外服务商的 OAuth 流程在国内直连可能超时,建议优化内网代理或使用国内替代连接器方案。版本锁定:生产环境发布时请固定 Docker Image Tag(如 1.0.2),避免使用 latest 标签以防破坏性更新导致服务中断。🔌 5. MCP与迁移适配MCP 本地接入:默认地址为 http://localhost:3000/mcp,部分第三方 Agent 宿主若报错超时,请手动调整 Socket Timeout 参数。Schema 兼容性:开源版与托管版共用 Schema,但在重新创建 OAuth Client Config(OAuth 客户端配置)时请注意版本差异。
Stirling
📘 Stirling PDF 平台核心指南一、平台简介🌟 GitHub No.1 Open Source Project | 🚀 下载量超 30,000,000+次Stirling PDF 是目前 GitHub 上排名第一的开源 PDF 处理与编辑平台。它最初为纯开源本地部署工具,现已演变为支持全场景的全能 PDF 生态:多端支持: 涵盖本地桌面、浏览器网页、私有服务器及 Docker 容器部署。核心优势: 主打隐私安全(数据不上传外网)与无限制处理。二、主要功能模块平台集成了丰富的编辑与管理能力,主要分为以下三大板块:1. 基础编辑与管理 📝文件操作: PDF 合并、拆分。页面控制: 旋转、重新排序、添加图片、删除页面。2. 高级转换与识别 🔁格式互转: PDF ↔ Word / Excel / PPT / 图片相互无损或高质量转换。OCR 技术: 内置强大的光学字符识别,将扫描件转换为可搜索文本。3. 安全与自动化 🛡️文件保护: PDF 压缩、数字签名、加密/解密、添加水印。信息清洗: 敏感内容涂黑(Redact)。流程编排: 支持无代码的 PDF 处理工作流管道 (Pipelines)。三、适用人群画像 🎯群体分类核心需求与场景高隐私企业与机构军工、政府、医疗、金融等行业,对数据主权及合规性(如 HIPAA, GDPR)有严格要求。IT 管理员/开发者需在局域网为全公司搭建统一工具,或通过 API 实现批量自动化处理 PDF 的技术人员。个人日常办公族频繁处理文档但希望避免支付 Adobe 昂贵订阅费的个人用户。四、授权模式与定价方案 Stirling PDF 采用 Open-Core(开源核心) 商业模式,根据使用场景灵活计费:🆓 Editor (编辑器版本)价格: ¥0 / 永久免费权益内容:包含全部 60+ 种编辑工具。无席位限制,支持单点登录 (SSO)。完全本地私有化运行(个人及中小型团队处理量 <10,000 张 PDF/天时无需付费)。⚙️ Processor (自动处理器版本)价格: 按量计费 | $0.01 / 每张 PDF权益内容:适合企业级合规审计与 API/Webhook 全面接入。AI 集成支持及大批量自动化流水线处理场景。🏢 Enterprise (企业定制版)价格: 定制报价适用对象: 超大规模用户(如处理量过百万)。权益内容: 物理隔离环境部署、高级合规控制、定制化 SLA 服务支持。 查看最新官方定价方案:https://stirling.com/pricing五、快速开始指南 🚀Stirling PDF 提供极高的灵活性,您可根据需求选择以下任意方式:1. 直接网页使用 👉 最简单快捷直接在 https://stirling.com 浏览器端上传文件即可处理。无需安装任何软件。2. 本地桌面端应用 🖥️ 离线办公推荐特点: 原生客户端,支持离线运行,无须登录。用法: 右键关联文件 -> “打开方式”选择 Stirling PDF App。3. Docker / 服务器私有化部署 🔧 适合技术团队一行命令即可在内网私有环境构建服务:bashdocker run -p 8080:8080 docker.stirlingpdf.com/stirlingtools/stirling-pdf docker run -p 8080:8080 docker.stirlingpdf.com/stirlingtools/stirling-pdf 访问地址: http://localhost:8080 (局域网内全网段可同步使用)。六、注意事项与版本信息 ⚠️在使用前,请务必关注以下两点重要变更:🔄 V2 版本升级状态平台现已全面升级为 V2 版,核心新功能包括:状态化处理: 上传一次文件后,可直接连续传给多个工具处理(无需重复上传下载)。历史记录功能: 支持全历史记录的“撤销/重做”操作。📦 本地依赖配置 (仅针对非 Docker 安装)如果您选择使用裸机 JAR 包方式安装而非 Docker:需本地自行配置 Java JDK (版本要求 25+)。需手动安装外部依赖环境:LibreOffice (用于 Office 转换)、Tesseract (用于 OCR 识别)。
RapidOCR
RapidOCR 使用指南一、平台介绍RapidOCR 是由 RapidAI 团队开发的开源离线 OCR 工具套件。其基于 PaddleOCR 进行了 ONNX 轻量化优化,旨在提供更快、更轻的识别方案。1. 核心特性纯本地运行:完全脱离云端依赖,无网络环境下即可工作。跨端轻量化:资源占用低,适合嵌入式及边缘设备。性能优越:推理速度远超原版 PaddleOCR。2. 开源协议与版权工程代码:采用 Apache 2.0 协议,完全开源免费。模型版权:识别模型的版权归属百度,商用需遵守相应协议(合规性已确保)。3. 配套地址导航📘 官方文档:https://rapidai.github.io/RapidOCRDocs/latest/💻 GitHub 源码:https://github.com/RapidAI/RapidOCR🔗 在线 Demo:https://huggingface.co/spaces/RapidAI/RapidOCRv2二、主要功能模块1. 文字识别能力默认支持:中英混合文本,包含数字与标点符号。特殊布局:支持竖排文本及多语言模型转换(如日韩文、繁体中文等)。输出结果:提供文字内容 txts、坐标框 boxes 及置信度分数 scores,并可生成带标注的可视化图片。2. 多推理后端支持用户可根据硬件环境按需选用不同的推理引擎:🏃♂️ rapidocr_onnxruntime(默认):轻量快速,通用性好。🧠 rapidocr_openvino:专为 Intel CPU 设备加速优化。🔗 rapidocr_paddle:原生 Paddle 推理接口,适合特定场景。3. SDK 与集成支持语言覆盖:提供 Python、C++、Java、C# 全平台开发包。应用场景:可轻松嵌入桌面软件、服务端系统或边缘计算设备中。4. 配套工具服务rapidocr_api:一键启动 HTTP 识别服务,对外暴露标准 API 接口。命令行工具:支持单张图片或批量图片的离线识别与结果导出。Docker 镜像:提供一键部署服务端环境的能力。5. 自定义微调能力支持开发者使用自有数据集进行模型微调。允许替换检测、识别及分类阶段的子模型,满足个性化需求。三、适用人群与场景建议✅ 推荐使用场景开发者群体:需要本地 OCR 集成、构建私有化系统或开发内网项目的技术人员。数据处理任务:批量处理票据、截图、扫描文档以提取文字,且对隐私敏感(严禁数据上传云端)的场景。桌面工具作者:正在制作自制截图 OCR、PDF 转 Word/文本提取器等独立软件的开发人员。中小企业 IT:部署于内网的文档管理系统、证件识别系统或表单数字化项目,希望避免云 API 调用费用及流量限制的用户。❌ 不适合场景零代码用户:没有编程基础且无命令行操作意愿的普通大众(软件本身不提供独立可视化 GUI)。特殊文本需求:超高精度古籍识别、复杂手写体文字等(该工具主要针对印刷体优化,专业手写 OCR 效果较弱)。四、免费与付费说明🚫 无隐形消费全程免费模式:不存在订阅制、按量计费或定价页面。永久开放权限:所有工程代码、推理包及基础中英模型均永久免费,个人与商业用途均可直接使用(需遵守开源协议)。💸 唯一的付费项开发者赞助:唯一涉及费用的项目是自愿向开发团队进行的 GitHub Sponsor 赞助。此行为非强制性质,也不用于解锁任何软件功能。无云端 API 收费:因工具纯本地运行,不存在云服务的调用次数、流量上限等计费体系。五、如何使用1. Python 环境安装在终端或命令行中执行以下指令进行基础依赖库的安装:bashpip install rapidocr onnxruntime pip install rapidocr onnxruntime 2. Python 代码调用示例支持读取本地图片路径,也支持直接传入网络图片 URL。pythonfrom rapidocr import RapidOCR # 初始化识别器(默认加载 ONNX Runtime) ocr = RapidOCR() # 执行识别:输入为图片文件名或 URL result = ocr("test.jpg") # 输出结果结构解析 print(result.txts) # 打印文字内容列表 print(result.boxes) # 打印坐标框列表 print(result.scores) # 打印置信度分数 # 生成带边框的标注图片保存至本地 result.vis("output.jpg") from rapidocr import RapidOCR # 初始化识别器(默认加载 ONNX Runtime) ocr = RapidOCR() # 执行识别:输入为图片文件名或 URL result = ocr("test.jpg") # 输出结果结构解析 print(result.txts) # 打印文字内容列表 print(result.boxes) # 打印坐标框列表 print(result.scores) # 打印置信度分数 # 生成带边框的标注图片保存至本地 result.vis("output.jpg") 3. 命令行快速识别工具无需编写代码,直接使用 CLI 进行批量处理:bashrapidocr -img test.jpg --vis_res rapidocr -img test.jpg --vis_res -v--verbose: 可开启详细日志输出。 -w--workers: 设置工作线程数(多线程加速)。4. 启动 HTTP 识别服务适合需要后端 API 对接 Web 或小程序的场景:bashrapidocr_api -p 9000 -workers 2 # POST http://127.0.0.1:9000/ocr -> 上传图片即可调用 rapidocr_api -p 9000 -workers 2 # POST http://127.0.0.1:9000/ocr -> 上传图片即可调用 5. 跨语言集成指引对于 C++、Java 或 C# 开发者,请查阅官方文档对应语言的 SDK 章节。通常流程为:下载对应的 ONNX 模型文件后,加载至相应语言的推理接口中复用代码逻辑。六、注意事项🔒 1. 网络与隐私安全字体依赖:首次运行可视化功能(vis())时会自动联网下载默认字体包。若处于断网环境,请注释 result.vis 方法或提前准备本地中文字体文件以规避报错。数据安全:所有图片均在本地内存处理完毕即销毁,无数据外传行为,非常适合涉密内网及隐私敏感场景使用。🛠️ 2. 环境兼容性配置Windows 依赖:必须在 Windows 系统安装 VC++ 2015+ 运行库(如 Visual Studio Build Tools),否则 onnxruntime 组件会因缺少 C/C++ 运行时而报错。Python 版本建议:推荐使用 Python 3.8 ~ 3.11 版本,过高或过低的版本可能导致第三方依赖包冲突或兼容性问题。⚡ 3. 性能优化技巧Intel CPU 加速:若使用 Intel 平台处理图片较多,优先选择 openvino 后端推理包,实测速度可提升 30%+。批量识别策略:避免在单进程中阻塞等待,建议启动多个实例或配置多进程(如开启 HTTP API 服务)来并发处理任务队列。📚 4. 模型能力边界认知文本类型限制:手写文字、艺术字等效果较差;最佳适配场景为印刷体文档、手机截屏、标准票据。多语言扩展:默认仅提供中英双语,若需识别其他语种(如日文),需要自行下载并配置对应的 ONNX 模型文件至环境目录中。⚖️ 5. 商用合规提示代码协议:工程源代码采用 Apache 2.0,使用自由无限制。模型版权注意:核心的 PP-OCR 模型版权归属百度。若用于商业用途(如对外售卖 SaaS、企业级集成),请务必阅读并遵守百度的开源模型协议及商业授权条款。🐳 6. Docker 部署细节模型挂载:Docker 启动时需手动将本地预训练模型目录挂载进容器,否则镜像首次运行会尝试自动下载大体积文件,耗时较长且占用带宽。嵌入式设备:硬件资源紧张(如树莓派)时,建议选用轻量级 small 尺寸模型,以减少内存与显存占用。🖥️ 7. GUI 界面缺失提醒原生提供的是 API/命令行接口,无预装的桌面版可视化软件。若需要图形化操作体验(如拖拽图片识别),开发者需自行封装界面或基于现有 Python SDK 开发前端程序。