pub-local-jarvis

Windows 上的本地多模态 AI 桌宠,能实时看屏幕、听系统声音,在合适时机主动提醒你或陪你聊天,数据不上传云端。

Github地址

https://github.com/LYiHub/pub-local-jarvis

项目功能特性

核心感知能力

  • 屏幕感知:每秒抓取一帧桌面画面,理解你在做什么
  • 音频感知:采集系统播放的声音,识别当前场景
  • 全双工交互:不是一问一答,AI 自己判断该安静观察还是开口说话

具体使用场景

  • 桌面陪伴:看剧、工作时偶尔弹出气泡点评或提醒
  • 游戏陪伴:识别游戏画面,用透明弹幕给提示,不会抢操作
  • 网课记录:自动抓关键画面,课后生成 Markdown 笔记
  • 主动对话:按 Ctrl+M 唤起对话框,直接问本地模型
  • 日程图:配置图像 API 后,把当天活动整理成可视化图片
  • 隐私模式:双击桌宠暂停感知,画面和音频立刻切断

隐私设计

  • 推理全在本地,原始画面和音频不保存
  • 只有生成日程图时才联网,且走用户自己配的 API
  • 课程模式只存精选画面和整理后的文字,不存完整录屏

部署方式

推荐:安装包(普通人直接用)

  1. 去 Releases 下 AI-Jarvis-Setup-0.1.2-x64.exe
  2. 双击安装,点”启动 AI 贾维斯”
  3. 首次启动自动下载 6.32GB 的 MiniCPM-o 4.5 模型,等完事就能用

环境要求:64 位 Win10/11、AVX2 处理器、12GB 以上硬盘空间。有 N 卡能 CUDA 加速,没显卡或 CUDA 炸了就自动切 CPU,只是慢一点。

源码运行(开发者)

需要 Python 3.12+、Git、CMake 3.24+、VS Build Tools、Node.js LTS、CUDA Toolkit 13.1+。命令:

1
cd desktopnpm run deps:installcd ...\start-real.cmd

构建安装包用 npm run build,产物在 desktop/dist/ 下。