SCM 是一个在 macOS 上对照片和视频进行本地 AI 搜索的工具,当前版本为 0.2.4。它通过视觉模型对每张照片和视频的每一帧建立索引,用户可以用自然语言描述查找内容,所有处理在本地完成,不需要账号、云端或上传。
技术实现机制
SCM 使用 ONNX Runtime 运行视觉模型,默认模型是 CLIP ViT-L/14@336,权重文件大小 435 MB。用户可以切换其他三个模型:SigLIP-2-B/16(412 MB)、SigLIP-2-L/16@256(850 MB)和 SigLIP-B/16@384(214 MB)。这些模型将图像和文本映射到同一向量空间,使得自然语言查询能够匹配视觉内容。
对于视频,SCM 在三个位置(20%、50%、80%)提取帧并平均其嵌入向量,生成整个视频的表示。语音转文字功能由 Whisper 模型提供,默认使用 tiny.en 版本(150 MB),也可选择 base.en(300 MB)。OCR 功能的默认语言包大小为 17 MB。
此外,SCM 集成了大语言模型用于更复杂的查询理解,默认使用 Qwen3 1.7B(1.1 GB),也可切换到 Llama 3.2 3B(2 GB)。所有内容通过 SHA-256 哈希去重。
系统要求与技术栈
SCM 要求 Apple Silicon 芯片和 macOS 12 及以上版本。项目使用 Electron 打包,Bun 作为包管理器和运行器,React 作为渲染器。开发者明确表示不包含遥测、账号或上传功能。
本地优先的权衡
本地运行意味着用户保留数据完全控制权,但代价是需要下载多个 GB 的模型文件,且索引和搜索性能受限于设备算力。对于大型照片库,初次索引可能需要较长时间。从技术选择看,SCM 优先考虑隐私和离线可用性,而非云端方案的便利性和跨设备同步能力。
目前尚无关于索引速度、搜索准确率或与系统自带 Spotlight 搜索对比的公开数据。