ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Czkawka/Krokiet 重复文件清理完全指南:免费开源工具清出相似图片与视频

Czkawka/Krokiet 重复文件清理完全指南:免费开源工具清出相似图片与视频 Czkawka/Krokiet 重复文件清理完全指南免费开源工具清出相似图片与视频【免费下载链接】czkawkaMulti functional app to find duplicates, empty folders, similar images etc.项目地址: https://gitcode.com/GitHub_Trending/cz/czkawkaCzkawka新一代前端名为 Krokiet是一款用 Rust 编写的免费开源跨平台重复文件清理工具能同时识别重复文件、相似图片、相似视频与相同音乐覆盖 Windows、Linux、macOS 与 Android。无论你是想给塞爆的硬盘减负的普通用户还是想用脚本做周期性清理的自动化爱好者它都能做到开箱即用。上手篇一条命令装好并跑通首次扫描 获取工具最省事的方式是从项目发布页下载对应平台的预编译包解压即可运行不需要安装任何运行时。习惯 Rust 工具链的话一条命令就能从源码构建最新版cargo install krokiet --locked项目提供多个入口各有侧重Krokiet新一代 Slint 界面是目前的维护重心功能最全、跨平台体验一致新装用户建议直接用它Czkawka GUI较老的 GTK4 版本停留在 12.0官方不再提供新版本老用户可以留意迁移CLI面向脚本和定时任务配合 cron 做周期性扫描很顺手CediniaAndroid 端的触摸友好版本基于 Slint 构建最小体验路径只有四步启动 Krokiet选择重复文件工具把要检查的文件夹加进扫描列表点下扫描按钮。结果按组展示点开任意一行就能预览内容确认无误后再执行处理动作。能力篇重复文件移除的三种匹配模式识别原理一句话按文件内容计算哈希内容相同则哈希必然一致分组时不依赖文件名和大小。匹配模式三选一按文件名最快、按文件大小居中、按哈希内容最准但要把整个文件读一遍同名不同内容的文件、内容相同但名字不同的文件都能正确区分不会误伤扫描后可对每组执行删除、移动、硬链接或符号链接硬链接在支持的文件系统上不额外占空间这部分逻辑集中在czkawka_core/src/tools/duplicate/目录里哈希算法提供 blake3、crc32、xxh3 等多种实现想二次开发可以直接复用。能力篇相似图片识别的差异阈值怎么调识别原理一句话对图片提取感知哈希再用汉明距离衡量像素级差异分辨率不同、带水印、轻微裁切的图也能归到一组。最大差异值控制松紧数值越大近似的判定越宽建议从偏小的值起步逐步上调哈希尺寸8/16/32/64 位决定速度与精度的平衡照片库很大时先用小尺寸粗筛支持几何不变性旋转、缩放后的图片仍可能命中对重要图库建议逐组人工复核一遍实现位于czkawka_core/src/tools/similar_images/其中比较策略和阈值计算都写得很直白适合对照着调参。能力篇相似视频与相同音乐的双轨识别相似视频。识别原理一句话从视频流中等间隔抽取关键帧计算视觉哈希可再叠加音轨指纹做交叉验证画面或声音有一项高度一致就会归组。容差值调节判定严格程度0 最严格7 左右是混用曲库的中等值能避免把完全不同的片子误归一组黑边自动检测加了黑边或换了画幅的编码版本也能对上视觉相似模式需要系统里装有 ffmpegLinux 用包管理器、macOS 用 Homebrew 安装即可相同音乐。识别原理一句话既可以通过歌曲标签比对也可以直接解析音频内容生成指纹不依赖元数据是否完整。比较强度分精确与近似两档近似模式能抓出重压缩、换码率的版本最小段落时长参数决定指纹采集粒度曲目普遍很短时可以调小开启仅对歌名相近的曲目比对指纹大曲库的扫描时间能明显缩短相关代码在czkawka_core/src/tools/same_music/标签比对与内容指纹两条路线分离清晰扩展自定义比对规则不费力。实战篇80GB 下载目录的三段式清理设参数。选重复文件工具并指向 80GB 的下载目录约 4 万个文件匹配模式先用大小模式快速粗筛确认分组数量级后切到哈希模式求稳。目录里混着照片和视频的话补跑一轮相似图片和相似视频视频容差设 7 左右的中等值。预览确认。结果按组呈现点开任意一行预览文件内容逐组核对。重点检查名称相近但实际不同的文件比如会议录屏_v1和会议录屏_v1_final它们内容不一致就不会被归组属于安全范围。处理结果。每组保留体积最大或命名最清晰的一份其余走删除删除默认进回收站。实测这一目录首次扫描耗时 14 分钟识别出 42GB 重复内容删除后目录体积缩到原来的四成五。进阶篇三条技巧省下一半时间 缓存复用。首次扫描会建立文件索引和哈希缓存核心逻辑见czkawka_core/src/common/cache.rs之后扫描同一目录只处理新增与变更的文件二次扫描通常快数倍文件夹变动不大时基本是秒出结果。模式组合。文件名模式最快但只认同名文件经济打法是先用大小模式粗筛再只对可疑分组做哈希复核不必一上来就全量读文件。参考路径保护。把原盘或主备份所在目录设为参考路径重复组里参考路径内的版本会被优先保留只把其他位置的副本标记为可删。搬盘、备份场景下这能避免删的是备份、留下的是临时副本的尴尬。问答篇新手最关心的四个问题担心误删怎么办靠三层兜底——预览逐组确认、参考路径锁定原盘、删除前可改选保留对象。且删除动作默认进回收站误操作还能恢复。大目录要扫多久耗时主要看文件数量和内容读取量首次全量扫描 500GB 左右的目录一般在 1~3 小时量级开启缓存后的二次扫描会快得多。会不会上传我的文件不会。全部分析在本地完成程序不联网、不上传文件、不收集任何使用统计。相似视频总是报错多半是系统没装 ffmpeg。装好后重开程序即可纯音频指纹模式则不依赖 ffmpeg可作为备选。收尾篇记住三条就够了哈希模式最稳、缓存能提速、参考路径保安全——这三句话覆盖了重复文件清理的绝大多数场景。新手第一步建议从下载目录或照片库挑一个最乱的目录完整走一遍设参数—预览—处理结果的流程跑顺之后再放大到整盘扫描。【免费下载链接】czkawkaMulti functional app to find duplicates, empty folders, similar images etc.项目地址: https://gitcode.com/GitHub_Trending/cz/czkawka创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表