perl:字符串模糊匹配,计算 edit 距离

Levenshtein Distance,通常被称为编辑距离(Edit Distance)。该算法的概念是俄罗斯科学家弗拉基米尔·莱文斯坦(Levenshtein · Vladimir)于1965年提出。
它是用来计算两个字串之间,通过替换、插入、删除等操作将字符串str1转换成str2所需要操作的最少次数。

也存在其他编辑距离的定义方式:例如 Damerau-Levenshtein 距离就是一种莱文斯坦距离的变种,但允许以单一操作交换相邻的两个字符(称为字符转置),如 AB→BA 的距离是 1(交换)而非 2(先删除再插入、或者两次替换); LCS(最长公共子序列)距离只允许删除、加入字元; Jaro 距离只允许字符转置; 汉明距离只允许取代字元。

fuzzy 中文是模糊的意思。

运行 cpan

install Text::Levenshtein

install Text::Levenshtein::XS

install Text::Fuzzy

编写 test_fuzzy.pl  如下

#!/usr/bin/perl
# test: Partial string matching using edit distances
use warnings;
use strict;
use utf8;
use Text::Fuzzy;

my $tf = Text::Fuzzy->new ('我是中国人');
print "distance is ",$tf->distance ('我是华人'), "\n";

# test: English
my $tf = Text::Fuzzy->new ('boboon');
print "Distance is ", $tf->distance ('babboon'), "\n";
my @words = qw/the quick brown fox jumped over the lazy dog/;
my $nearest = $tf->nearestv (\@words);
print "Nearest array entry is $nearest\n";

运行 perl test_fuzzy.pl

 distance is 2
Distance is 2
Nearest array entry is brown

参阅:字符串模糊匹配

相关推荐

  1. perl字符串模糊匹配计算 edit 距离

    2024-03-31 18:02:01       38 阅读
  2. lua字符串模式匹配

    2024-03-31 18:02:01       29 阅读
  3. C#实现字符串模糊匹配

    2024-03-31 18:02:01       26 阅读
  4. 【C#】C#匹配两个相似的字符串莱文斯坦距离

    2024-03-31 18:02:01       40 阅读
  5. 字符串匹配

    2024-03-31 18:02:01       28 阅读
  6. perf kvm to profile vm_exit

    2024-03-31 18:02:01       33 阅读

最近更新

  1. docker php8.1+nginx base 镜像 dockerfile 配置

    2024-03-31 18:02:01       98 阅读
  2. Could not load dynamic library ‘cudart64_100.dll‘

    2024-03-31 18:02:01       106 阅读
  3. 在Django里面运行非项目文件

    2024-03-31 18:02:01       87 阅读
  4. Python语言-面向对象

    2024-03-31 18:02:01       96 阅读

热门阅读

  1. linux 系列文章目录 - 打包压缩命令之tar命令

    2024-03-31 18:02:01       40 阅读
  2. OSPF与静态路由配置实验介绍

    2024-03-31 18:02:01       39 阅读
  3. 二叉树的遍历C语言

    2024-03-31 18:02:01       46 阅读
  4. 【PySide6】PySide6安装及VSCode配置PySide6环境

    2024-03-31 18:02:01       44 阅读
  5. 专升本-物联网

    2024-03-31 18:02:01       37 阅读
  6. linux下I/O多路复用

    2024-03-31 18:02:01       40 阅读
  7. 今天给兄弟姐妹们投喂一些vim的命令组合

    2024-03-31 18:02:01       35 阅读
  8. C++经典面试题目(十三)

    2024-03-31 18:02:01       35 阅读
  9. python学习之-分支结构-入门训练

    2024-03-31 18:02:01       33 阅读
  10. 面试题:Spring Boot Starter的功能与使用场景

    2024-03-31 18:02:01       38 阅读