按行去重,并且保持原有顺序
去重单位是行(换行符会先统一成 \n),不是段落也不是句子。重复出现的行只保留第一次出现的那一条,位置不变 —— 后面的重复行直接删掉。
保序很重要:整理名单、关键词表、URL 列表时,你通常希望结果还按原来的顺序排着,而不是被重排一遍。
三个开关分别管什么
忽略大小写(默认开):Apple 和 apple 视为同一行。忽略行首尾空白(默认开):行首行尾的空格和制表符不参与比较。保留空行(默认关):关着的时候,纯空白行会被直接剔除。
注意一个边界:行内的多余空白处理不了。「北京 朝阳」和「北京 朝阳」(中间两个空格)仍然算两行。要统一行内空格,先用文本替换工具处理一遍。
排序的两个坑
可选排序,默认不排。数字排序只识别行首的连续数字,所以 file2 会排在 file10 前面 —— 这是按数值而不是按字符串比较的结果。
但字符串排序用的是字符编码序,不是拼音序。也就是说中文排出来既不是拼音顺序也不是笔画顺序,整理中文名单时请别指望它,用表格软件排更靠谱。
统计数字怎么用
结果区会给出输入行数、输出行数、重复行数和「最多重复次数」—— 最后这个数字能直接告诉你脏数据有多严重:某条重复了 30 次,说明上游导出环节有问题,值得回头查。
处理前后行数的差就是被清掉的行数,核对导出结果时看这两个数是否对得上预期。
本地处理,名单可以放心粘
整个处理在浏览器里完成,没有网络请求,文本不上传。客户名单、手机号清单、内部 ID 列表直接粘进来整理,不会外流。
结果写进只读文本框,点「复制结果」带走;末尾的换行会被保留,粘回表格时不会出现最后一行错位。
它做不到什么
只认完全相同的行,不做模糊去重 —— 差一个标点、多一个空格的两行不会被合并。要处理这种「近似重复」,得先做清洗(统一标点、去空格),再交给本页。
也不支持按列去重:如果一行里有多个字段、只想按其中某一列判重,请先在表格软件里把那一列单独拆出来。
常见问题
去重后顺序会变吗?
不会。保留每行第一次出现的位置与内容,只删除后续重复行,结果顺序与原文一致。
为什么「北京 朝阳」和「北京 朝阳」没被合并?
本页只能忽略行首行尾空白,处理不了行内多余空格。先用文本替换把连续空格统一成一个再去重。
中文能按拼音排序吗?
不能。字符串排序按字符编码序,不是拼音序也不是笔画序。中文名单请用表格软件排序。
file2 能排在 file10 前面吗?
能。排序时行首的连续数字按数值比较,所以 file2 会排在 file10 之前。