Skip to content

文件整理、归档与知识管理

桌面和下载目录是电脑在替人承受混乱

桌面、下载目录、微信文件接收目录是典型的“电脑在替人承受混乱”的场景:电子发票、截图、PDF、微信下载文件、邮件附件混在一起,命名方式各不相同。人不在电脑前时,最烦的不是不知道怎么整理,而是不知道哪几张发票已经在电脑里、哪些字段还缺、哪些文件可能重复。

远程批量整理最怕误删、覆盖、移动原件,导致后面找不回来。所以文件整理的第一条规则是:第一轮只读盘点,不移动、不改名、不删除,只生成预览清单。确认后再分批执行,删除操作单独审批。

mermaid
flowchart LR
    A[只读扫描目录] --> B[输出盘点报告]
    B --> C[定分类命名重复归档规则]
    C --> D[输出移动重命名预览]
    D --> E{人工确认?}
    E -->|否| F[调整规则]
    F --> D
    E -->|是| G[分批执行]
    G --> H[生成变更日志]
    H --> I[删除操作另行审批]

主案例一:整理桌面发票,不再回电脑前翻文件

场景:报销季,电子发票、截图、PDF 散落在桌面、下载目录和微信文件接收目录,文件名只叫“发票.pdf”“image.png”“微信图片_2026xxxx.jpg”。报销真正需要的是结构化字段:抬头、税号、金额、开票日期、发票号码、销售方。

第一步:只读扫描,返回候选清单

扫描范围只包括桌面、Downloads 和微信文件接收目录,时间范围为最近 30 天。第一步先返回候选清单和数量,不要移动、覆盖或删除原文件:

text
请帮我整理电脑里的发票,但不要删除、移动或覆盖原文件。
扫描范围只包括桌面、Downloads 和微信文件接收目录,时间范围为最近 30 天。
候选条件:文件名包含“发票”“电子发票”“invoice”,或内容识别为发票的 PDF、JPG、PNG。
第一步先返回候选清单和数量。
第二步识别抬头、税号、金额、开票日期、发票号码、销售方、文件路径。
第三步生成 invoice-ledger.xlsx,并列出“重复发票”和“无法识别字段”的人工确认清单。

ps:执行后仅新增台账文件,桌面原发票不移动、不改名、不删除。

第二步:人工确认无法识别字段

识别不出来的字段(模糊截图、手写发票)进入“无法识别字段”清单,由人确认,不让模型猜。重复发票按发票号码去重,但保留重复来源路径。

主案例二:按客户和年份归档项目材料

场景:项目文件夹混乱,但要按客户和年份归档,且不允许误删和覆盖。

第一步:只读盘点

第一轮只读扫描,输出盘点报告:文件数、类型分布、大小、重复候选、空目录和无法识别的文件。不要移动、改名、删除任何文件。

第二步:定义分类、命名和归档规则

规则示例谁定
分类维度客户 / 项目 / 年份 / 类型项目负责人
命名规则日期前缀 + 项目代号团队约定
重复判断键文件名 + 大小 + 哈希数据负责人
归档保留范围近 3 年活跃,更早转归档管理要求

第三步:输出移动与重命名预览

text
只读扫描当前项目目录。按客户、项目、年份和文件类型提出整理方案。
第一轮禁止移动、改名、覆盖和删除。
输出 inventory.csv、move-preview.csv、duplicate-candidates.csv 和 naming-rules.md。
每条建议必须包含原路径、目标路径、判断理由和风险提示。

预览覆盖全部文件,你可以抽查和调整。每个文件都有原路径、目标路径和分类理由。

第四步:人工确认后分批执行,生成变更日志

人工确认预览后分批执行,建议先跑一个子目录验证再扩大。执行过程中断可从变更日志恢复,不要一次执行几千个文件。生成变更日志(原路径→新路径、操作时间、操作人),删除操作单独审批,第一轮整理不做删除,只移动和归档。

延伸:识别重复文件并生成候选清单

重复文件不一定能直接删。按文件名 + 大小 + 哈希判断候选后,输出 duplicate-candidates.csv,列出每组的路径、大小和最后修改时间,由人确认哪份是主、哪份是冗余。合同、财务和人事文件按组织规则处理,不能只按文件名猜分类。

文件整理常见错误

常见错误为什么会发生更好的写法
第一轮就移动或删除文件急于整理第一轮只读盘点,只生成预览
一次执行几千个文件图快先跑一个子目录验证,分批执行
没有变更日志没留恢复依据每次操作记原路径→新路径、时间、操作人
删除和移动混在一起没区分风险删除单独审批,第一轮只移动和归档
按文件名猜分类忽略文件内容合同财务人事文件按组织规则,不只看文件名