🔀

字符串相似度

计算两个字符串的编辑距离(Levenshtein)与相似度百分比。

本地处理 · 不上传

加载工具中…

相关:编辑距离 · Levenshtein · 字符串相似度 · 文本比对 · 模糊匹配

字符串相似度计算两段文本的编辑距离——把一个变成另一个所需的最少增删改次数,并给出归一化的相似度百分比。用于查重、纠错与模糊匹配。

使用步骤

  1. 输入两个字符串
  2. 查看编辑距离与相似度
  3. 查看具体的差异位置
  4. 调整后重新比较

使用场景

  • 判断两条记录是否为同一实体的不同写法
  • 实现搜索的拼写纠错建议
  • 数据清洗时找出近似重复项
  • 比较文件名或标题的相似程度

小贴士

  • 编辑距离是绝对值,长文本的距离天然更大,跨长度比较应看归一化后的相似度而非原始距离。
  • 中文按字计算距离,一个汉字算一次编辑;若按字节计算,一个汉字的差异会被算成三次,结果失真。
  • 模糊匹配的阈值需要按业务实测确定,通常相似度 0.85 以上才比较可靠,过低会引入大量误判。

常见问题

编辑距离和相似度什么关系?

相似度通常定义为 1 减去编辑距离除以较长字符串的长度。距离越小相似度越高,后者的好处是与文本长度无关,便于设阈值。

能用来查重吗?

适合短文本(姓名、地址、标题)的近似匹配。长文档查重应使用分词后的余弦相似度或 SimHash,编辑距离在长文本上计算量大且不敏感。

为什么有的算法结果不同?

编辑距离有多个变体:标准 Levenshtein 允许增删改,Damerau 版本额外允许相邻字符交换,Hamming 距离只允许替换。选用变体不同结果自然不同。

字符串相似度是免费的吗?

是。本站所有工具完全免费,无需注册登录、无广告干扰,打开即用。

使用字符串相似度,我的数据安全吗?

安全。该工具在你的浏览器本地完成处理,输入内容不会上传到服务器,隐私更有保障。