有誰知道Damerau-Levenshtein距離算法的MySQL實現作爲一個存儲過程/函數,它將單個指定字符串作爲參數並查找字符串的模糊匹配在特定表格的特定領域?
我已經找到了比較兩個指定字符串並計算出距離的各種過程/函數代碼示例,但首先這只是Levenshtein距離算法,而不是Damerau-Levenshtein算法,其次,我沒有看比較兩個字符串,但在我選擇的字段中找到與我指定的字符串類似的模糊匹配。
我基本上試圖把一個模糊關鍵字搜索器放在一起。MySQL中的Damerau-Levenshtein距離算法作爲函數
回答
在MySQL Levenshtein and Damerau-Levenshtein UDF’s你有幾種這種算法的實現。
謝謝。看看如何使用它們的例子,它似乎仍在比較兩個指定的字符串。這是正確的嗎? – user1236443
該算法在http://en.wikipedia.org/wiki/Damerau%E2%80%93Levenshtein_distance中有詳細描述。 – user1929959
UDF安裝過程對我無效。如果我做CREATE FUNCTION damlev RETURNS INTEGER SONAME'damlev.dll';我得到了\t錯誤代碼:1126.無法打開共享庫'damlev.dll'(錯誤:126找不到指定的模塊)。 – user1236443
Github正在進行修改以修改Sean Collins代碼,因此它具有UTF-8支持並且不區分大小寫。
實施例:
mysql> select damlevlim('camión', 'çamion', 6);
+--------------------------------------+
| damlevlim('camión', 'çamion', 6) |
+--------------------------------------+
| 0 |
+--------------------------------------+
1 row in set (0.00 sec)
此做模糊匹配時是特別有用的。
mysql> select word,damlevlim(word, 'camion') as dist from wordslist where damlevlim(word, 'camion', 7)<1 limit 2;
+--------+------+
| word | dist |
+--------+------+
| camión | 0 |
| camios | 1 |
+--------+------+
2 row in set (0.00 sec)
這似乎是一個老話題,但應該有人找了MYSQL實現Damerau-Levenshtein距離的,這是我自己的實現(基於一個簡單的萊文斯坦發現本網站上的其他地方),它工作正常對於長度小於255個字符的字符串。第三個參數可以被設置爲FALSE,以檢索基本Levenshtein距離:
CREATE FUNCTION levenshtein(s1 VARCHAR(255), s2 VARCHAR(255), dam BOOL)
RETURNS INT
DETERMINISTIC
BEGIN
DECLARE s1_len, s2_len, i, j, c, c_temp, cost INT;
DECLARE s1_char, s2_char CHAR;
-- max strlen=255
DECLARE cv0, cv1, cv2 VARBINARY(256);
SET s1_len = CHAR_LENGTH(s1), s2_len = CHAR_LENGTH(s2), cv1 = 0x00, j = 1, i = 1, c = 0;
IF s1 = s2 THEN
RETURN 0;
ELSEIF s1_len = 0 THEN
RETURN s2_len;
ELSEIF s2_len = 0 THEN
RETURN s1_len;
ELSE
WHILE j <= s2_len DO
SET cv1 = CONCAT(cv1, UNHEX(HEX(j))), j = j + 1;
END WHILE;
WHILE i <= s1_len DO
SET s1_char = SUBSTRING(s1, i, 1), c = i, cv0 = UNHEX(HEX(i)), j = 1;
WHILE j <= s2_len DO
SET c = c + 1;
SET s2_char = SUBSTRING(s2, j, 1);
IF s1_char = s2_char THEN
SET cost = 0; ELSE SET cost = 1;
END IF;
SET c_temp = CONV(HEX(SUBSTRING(cv1, j, 1)), 16, 10) + cost;
IF c > c_temp THEN SET c = c_temp; END IF;
SET c_temp = CONV(HEX(SUBSTRING(cv1, j+1, 1)), 16, 10) + 1;
IF c > c_temp THEN SET c = c_temp; END IF;
IF dam THEN
IF i>1 AND j>1 AND s1_char = SUBSTRING(s2, j-1, 1) AND s2_char = SUBSTRING(s1, i-1, 1) THEN
SET c_temp = CONV(HEX(SUBSTRING(cv2, j-1, 1)), 16, 10) + 1;
IF c > c_temp THEN SET c = c_temp; END IF;
END IF;
END IF;
SET cv0 = CONCAT(cv0, UNHEX(HEX(c))), j = j + 1;
END WHILE;
IF dam THEN SET CV2 = CV1; END IF;
SET cv1 = cv0, i = i + 1;
END WHILE;
END IF;
RETURN c;
END
- 1. Mysql距離函數
- 2. 距離計算函數的優化
- 3. 如何爲Traveling Salesman算法定義時間距離函數
- 4. mysql中的道路距離計算
- 5. 在mysql查詢中的距離計算
- 6. 計算「作爲烏鴉」的距離php
- 7. 用於計算Haversine距離的MySQL函數
- 8. 算法的距離度量
- 9. K-means算法具有任意距離函數MATLAB(切比雪夫距離)
- 10. 加速R算法來計算Hellinger距離的距離矩陣
- 11. 自定義MySQL函數來計算Haversine距離?
- 12. .NET中的Jaro-Winkler距離算法
- 13. 計算距離位置的距離 - iPhone
- 14. 如何計算距離cellID的距離?
- 15. 設置距離作爲MinHashing算法的相似性度量
- 16. 在MySQL中計算距離並在.NET中顯示它們之間的距離
- 17. 分別計算Levenshtein距離算法中刪除的數量
- 18. 找到距離地點最小總距離的點的算法
- 19. 計算距離
- 20. 計算距離
- 21. 計算距離
- 22. 計算距離
- 23. 計算距離
- 24. 計算距離
- 25. 計算距離
- 26. 計算距離
- 27. 計算距離
- 28. 計算距離
- 29. Geokit距離計算奇數
- 30. Dijkstra算法 - 如何計算距離?
[MySQL的已經有一些模糊匹配能力](http://theunderweb.com/doing-a-fuzzy-match-of-名,在MySQL的-同音-和音位-algorithms.html)。你嘗試過嗎? –
我需要一個更靈活的算法,不限於英文,並且可以處理換位。 Soundex似乎返回了大量假定位。 – user1236443
我覺得雙倍音量是爲名字設計的,而不是大文本。我的搜索欄包含很多文字。 – user1236443