本地优先 · 隐私安全 · Chrome + Web + AI Worker

看到什么,就采集什么
再交给本地 AI 去学

Pi Agent 是一款本地优先的通用采集与学习助手。Chrome 里右键或快捷键即可采集网页、视频、文本、截图与笔记;本地 yt-dlp / whisper / ffmpeg 自动处理视频与字幕;本地 LLM 完成摘要、词汇、翻译等分析。采集与处理全程在你的设备上完成,绝不上云。

Chrome 扩展采集· Web 管理端· 本地 AI Worker

为什么是 Pi Agent

围绕「采集、处理、学习」三点,把本地 AI 工作流做到开箱即用。

五种方式一键采集

网页正文、视频页、选中文本、截图、快速笔记——右键菜单「π Pi Agent」或 Alt+Shift 快捷键随时唤起,检测页面类型自动推荐采集模式。

视频资源全自动

yt-dlp 下载视频、封面与元数据,ffmpeg 提取标准音频,whisper 本地转写字幕——一条任务产出视频、音频、字幕、封面全套资源。

本地 whisper 字幕

用本地 whisper small 模型对音频转写,生成带时间轴的 srt / vtt 字幕;站内字幕缺失时自动补充,全程 CPU 本地完成。

本地 LLM 分析

对素材一键生成摘要、词汇表、翻译、影子练习与理解测验,直接在 Web 端查看结果,无需手动复制到任何云端对话。

素材资源管理中心

Web 管理端集中查看视频播放器、音频、封面、字幕与元数据,每个资源可在线预览与下载;删除素材时同步清理磁盘文件。

AI Console 对话

内置 Chat 工作台,直接与本地 Qwen3.5 / Qwen3.6 对话;素材分析结果与对话记录都在本地服务内完成。

多模态模型栈

识别并接入 oMLX 本地模型:对话、推理、视觉 VLM、ASR/STT、TTS、OCR、Markdown 解析,按用途自动分类展示。

全链路本地闭环

Chrome 采集 → 本地后端编排 → yt-dlp/whisper/ffmpeg 处理 → 本地 LLM 分析,数据存于本地 data 目录,不依赖任何云端服务。

轻量模式可用

未配置 LLM 时仍可正常采集与保存(Capture-only),AI 分析随时可后补——本地模型与媒体工具状态一目了然。

工作原理

四步把看到的内容变成可学习的本地素材,全程在你的设备上。

1

Chrome 一键采集

右键菜单或快捷键发起采集:页面正文、选中文本、截图或视频页;内容脚本提取标题、正文与视频元数据。

2

本地后端编排

采集数据提交到本地后端(127.0.0.1:8787),创建素材记录并挂起媒体任务队列,实时记录进度与日志。

3

AI Worker 处理

yt-dlp 下载视频与封面、ffmpeg 提取音频、whisper small 转写字幕;随后本地 LLM 对内容做摘要、词汇等分析。

4

Web 查看与学习

管理端查看视频/音频/字幕/封面全套资源,在线播放与预览,随时用本地 LLM 重新分析或继续对话。

支持的本地模型栈

直接对接 OpenAI 兼容的本地 oMLX 服务(默认 127.0.0.1:8085),以下模型为真实可用配置。

用途 模型 说明
对话 / 分析 Qwen3.5-9B-MLX-8bit 默认对话与素材分析(摘要/词汇/翻译/测验)。
深度推理 Qwen3.6-35B-A3B-UD-MLX-4bit MoE 高精度推理,处理复杂长文本。
视觉 VLM Qwen3-VL-8B-Instruct-MLX-4bit 图像理解与多模态问答。
高精度 ASR mlx-community--whisper-large-v3-turbo-asr-fp16 语音识别,高精度场景下可选。
轻量 STT mlx-community--Qwen3-ASR-1.7B-8bit 中英文轻量语音识别。
语音合成 mlx-community--Qwen3-TTS-12Hz-0.6B-Base-8bit 本地 TTS 语音合成。
OCR unlimited-ocr-mxfp8-mlx 截图像素级文字识别。
文档解析 MarkItDown 文件/网页内容转 Markdown。

媒体处理由本地 yt-dlp / whisper / ffmpeg 完成,后端启动时自动探测可用性与版本。

五个系统,一个闭环

感知、控制、编排、计算、陪伴——本地优先的分层架构。

Sensor · Chrome 扩展

感知层:在浏览页面内完成页面快照、选区、截图与视频检测,数据提交到本地后端。

Control · Web 管理端

控制层:Dashboard、素材库、Media Worker、AI Console 与设置,统一管理全部能力。

Agent Core · 编排

编排层(规划中):任务状态机与跨设备会话调度,Chrome 与 iOS 采集汇入同一素材流。

AI Worker · 计算

计算层:yt-dlp / ffmpeg / whisper 媒体流水线 + oMLX 本地 LLM,后台任务带进度与日志。

Companion · iOS(规划中)

执行陪伴层:移动端采集与随身学习,经本地 Gateway 接入同一套素材与模型服务。

全部本地运行

后端 8787 与 LLM 8085 均在本机;Chrome 采集数据只发往 127.0.0.1,不经过任何云端。

开始用 Pi Agent

Chrome 扩展负责采集,本地后端负责编排,Web 端负责管理——三件套开箱即用。

Chrome 扩展 · 已可用 macOS · 已可用 iOS · 规划中 Windows · 规划中

提示:Chrome 扩展需在开发者模式加载 dist 目录;本地后端与 Web 端通过 pnpm 一键启动。

使用说明

四步上手,从安装到第一次采集与学习。

1

安装 Chrome 扩展

构建扩展(pnpm build:extension),在 chrome://extensions 开启开发者模式并「加载已解压的扩展程序」,选择 dist 目录。右键任意页面即可看到「π Pi Agent」菜单。

2

启动本地后端与 Web 端

在项目根目录运行 pnpm dev:server 启动编排后端(8787),pnpm dev:web 打开管理端(5174)。后端会自动探测 yt-dlp、whisper、ffmpeg,并检测本地 oMLX 与模型。

3

采集与处理

右键「保存选中文本 / 截图 / 运行 Pi Agent」或按 Alt+Shift+P 唤起采集;视频素材在 Media Worker 页下载,whisper 自动生成字幕,AI 分析随时可跑。

4

在管理端学习

Artifacts 页在线播放视频、音频,预览字幕,一键生成摘要/词汇/翻译/测验;AI Console 直接与本地模型对话,素材与结果全部保留在本地。

常见问题

关于隐私、工具与使用的常见疑问。

我的语音和采集内容会被上传到云端吗?

不会。Chrome 采集只发送到本地后端(127.0.0.1:8787),媒体处理由本地 yt-dlp / whisper / ffmpeg 完成,AI 分析对接本地 oMLX(127.0.0.1:8085)。全部数据保存在本机 data 目录,不依赖任何云端服务。

需要安装哪些本地工具?

视频下载需要 yt-dlp,转写需要 whisper(openai-whisper,模型缓存在 ~/.cache/whisper),处理需要 ffmpeg。后端启动时自动探测三者,缺哪个会明确提示。

视频的字幕是怎么来的?

下载视频后自动用本地 whisper small 对提取的音频转写,生成带时间轴的 srt / vtt;也会尝试获取站内英文字幕作为补充。整个转写过程在本地完成。

必须连接本地 LLM 才能用吗?

不需要。未配置 LLM 时进入「轻量模式」(Capture-only),采集与媒体处理照常工作;之后配置好本地 oMLX 即可补跑 AI 分析。

Chrome 扩展如何安装?

构建后(pnpm build:extension),在 chrome://extensions 开启开发者模式,点击「加载已解压的扩展程序」选择 dist 目录。右键菜单与快捷键(Alt+Shift+P / Alt+Shift+S)即可使用。

截图存在哪里?能查看吗?

截图以文件形式保存在本地 media 目录(不占用 chrome.storage 配额),Web 端 Artifacts 页可直接预览图片、播放视频与音频。

iOS 版什么时候推出?

Companion(iOS)处于规划中,将支持移动端采集与随身学习,经本地 Gateway 接入同一套素材与模型服务,音频不上云。

删除素材会清理磁盘文件吗?

会。Web 端删除素材时,后端同步删除其关联的视频、音频、字幕、封面与产物文件,并回收空目录,避免磁盘残留。