在线工具

工具箱 › 文本 › 文本去重

文本去重与排序

在线对文本按行去重,可选择忽略大小写与首尾空白、是否排序以及数字按数值排序,并统计重复行数与最高重复次数。纯浏览器处理。

按行去重,并且保持原有顺序

去重单位是行(换行符会先统一成 \n),不是段落也不是句子。重复出现的行只保留第一次出现的那一条,位置不变 —— 后面的重复行直接删掉。

保序很重要:整理名单、关键词表、URL 列表时,你通常希望结果还按原来的顺序排着,而不是被重排一遍。

三个开关分别管什么

忽略大小写(默认开):Apple 和 apple 视为同一行。忽略行首尾空白(默认开):行首行尾的空格和制表符不参与比较。保留空行(默认关):关着的时候,纯空白行会被直接剔除。

注意一个边界:行内的多余空白处理不了。「北京 朝阳」和「北京 朝阳」(中间两个空格)仍然算两行。要统一行内空格,先用文本替换工具处理一遍。

排序的两个坑

可选排序,默认不排。数字排序只识别行首的连续数字,所以 file2 会排在 file10 前面 —— 这是按数值而不是按字符串比较的结果。

但字符串排序用的是字符编码序,不是拼音序。也就是说中文排出来既不是拼音顺序也不是笔画顺序,整理中文名单时请别指望它,用表格软件排更靠谱。

统计数字怎么用

结果区会给出输入行数、输出行数、重复行数和「最多重复次数」—— 最后这个数字能直接告诉你脏数据有多严重:某条重复了 30 次,说明上游导出环节有问题,值得回头查。

处理前后行数的差就是被清掉的行数,核对导出结果时看这两个数是否对得上预期。

本地处理,名单可以放心粘

整个处理在浏览器里完成,没有网络请求,文本不上传。客户名单、手机号清单、内部 ID 列表直接粘进来整理,不会外流。

结果写进只读文本框,点「复制结果」带走;末尾的换行会被保留,粘回表格时不会出现最后一行错位。

它做不到什么

只认完全相同的行,不做模糊去重 —— 差一个标点、多一个空格的两行不会被合并。要处理这种「近似重复」,得先做清洗(统一标点、去空格),再交给本页。

也不支持按列去重:如果一行里有多个字段、只想按其中某一列判重,请先在表格软件里把那一列单独拆出来。

常见问题

去重后顺序会变吗?

不会。保留每行第一次出现的位置与内容,只删除后续重复行,结果顺序与原文一致。

为什么「北京 朝阳」和「北京 朝阳」没被合并?

本页只能忽略行首行尾空白,处理不了行内多余空格。先用文本替换把连续空格统一成一个再去重。

中文能按拼音排序吗?

不能。字符串排序按字符编码序,不是拼音序也不是笔画序。中文名单请用表格软件排序。

file2 能排在 file10 前面吗?

能。排序时行首的连续数字按数值比较,所以 file2 会排在 file10 之前。