【开发者自荐】搜忆(Soum)— 本地文件语义搜索工具,用自然语言找文件

受够了"文件名记不清、内容翻遍硬盘"的找文件体验?自己Vibe Coding了一款工具。
既满足自己的日常需求,又体验一把Vibe Coding的魅力

搜忆是一款本地文件语义搜索工具,基于 Qt/C++ 开发,核心特点是:

  • 自然语言搜索:输入"去年Q3的财务报表"就能找到,不用精确匹配文件名
  • 本地索引,隐私安全:所有数据存本地,不上传云端
  • 支持多种格式:Markdown、PDF、TXT、代码文件等纯文本内容都能搜
  • 轻量低占用:索引完成后后台静默运行,不影响日常使用
  • Windows 平台,单文件安装,开箱即用

适合场景:本地文档管理、代码库搜索、笔记检索、知识库查找。

下载地址
1.0+版

https://modelscope.cn/datasets/rlf001/Soum-releases/resolve/master/Soum_v1.5.0_Setup.exe

UI改版2.0+:

https://modelscope.cn/datasets/rlf001/Soum-releases/resolve/master/Soum_v2.1.8_Setup.exe

欢迎试用反馈

当前版本 v2.1.8

2 个赞

质量太低了。

  1. Qt框架好评,不是Electron的都好评
  2. 不支持yaml索引,我不知道你所说的50大类到底指哪些,也没找到任何有详细描述的地方
  3. 还没索引完成就闪退了,鲁棒性太差,这还只是纯pdf,大概60个左右,某个pdf600页+,其余的都是2-3页
  4. 搜索效果太差,搜索走读出来了一堆风马牛不相及的东西,走读一共有一堆文件,就搜了一个出来,也没搜到docx,连自己写的介绍都是纯画饼

  5. ui太差,字体糊了吧唧的不说,还贼小,一看就是没适配系统缩放
  6. 总体评价,与市面上已有的全文搜索软件差距太大,没有看到收费的可能性,建议从头重造

你到底发布之前自己测过没有???

1 个赞

太中肯的建议了。
感谢,感谢。
大文件的压力测试的确没有做到位 :joy: 我日常文件数量和大小小那么一些。
UI是原皮 :joy:
多文档格式没搜到和准确度,我再来功能调试下、定位下问题
再次感谢使用和反馈

你这个功能其实和那些龙虾类的有点重叠

是的 是的。 我是考虑到一个文档隐私性。
我自己是这样的,有些文件不放心用云AI
因为是本地AI模型,不需要把私有文档云端管理、解析

本地ai?你基于语言大模型?

你这个其实更适合做成多版本发布,龙虾版,,exe版,quicker版,utools版

是的 轻量版语言大模型。 所以在性能和精准度上会有所得失

哥们,咱先别说模糊搜索的事情,先把精确搜索做完再说吧……如果准确搜索都做不完那你做模糊搜索有啥用呢

参考成熟软件anytxtOpenSearcherbbdoc

1 个赞

给everything做不补充插件呢

噪声躲不掉。小 embedding 单独扛召回就是这样,向量里"财务报表"和"报销单"挨得很近,余弦分不开这俩。关键词先出候选,embedding 只在候选里重排,别让它当第一道筛。

还真别说,我一开始就是因为everything只能精准搜索,才想搞一个模糊搜索的工具。 因为我自己就是everything的使用者,精准搜索是真好用

这是技术流,专业的

要不然不用embedding ,现在公认目录+搜索工具会比这个好,可以试试这个路径

听取这一阵子同学们的建议与意见,继续迭代与优化:
Soum v1.5.0 发布说明
:bullseye: 核心提升:更稳、更快、更准
从 v1.2.0 到 v1.5.0
聚焦稳定性加固
搜索准确性优化
解决、优化大文件崩溃、内存爆炸、搜索结果不准等痛点体验问题。

思路挺好。

我理想的状态是这个方式:

ai 读取文件内容, 自动生成tag,装入数据库。

这个tag 工作,如果是人来做,会非常繁琐。 ai可以生成 时间,地点,人物,事件,数字,关键名称 等复杂的tag

需要检索时, 先检索数据库,然后ai找到相关类似文件,再提取给用户。

1 个赞

继续优化:2.1.8 屏幕分辨率适配