
正文
php数据库相似度 php 文本相似度
提示:扫一扫查出行【扫一扫了解最新限行尾号】
复制提示
php+mysql 怎么让一段字符串 和 数据库中的 指定字段 比较他们内容的相似度,然后按相似度排序?
纯sql的话,应该实现不了,相似的这个应该还是PHP来处理的,排第三的都没有相似的内容了,也要显示。那就是所有的数据,然后再foreach来做对比判断,我觉得可以将字符串分为数组,然后对比两个数组的交集个数,再按交集的个数来排序
相关问答
Q1: php+mysql 怎么让一段字符串和数据库中的指定字段 比较他们内容的相似度,然后按相似度排序?
根据你的需求,需要再详细一点,给一个具体的排序顺序:
例如:首先根据什么
性别、年龄、学历、行业、体型,是这个顺序吗?
如果是这个顺序;
你在mysql查询的时候:
select * from member order by 【性别的字段】 desc, 【年龄的字段】 desc ,【行业】desc .....等等,就可以了;
Q2: php 怎么匹配两个字符串的相似度
php自带一个函数similar_text,可以计算两个字符串的相似度,但是这个的准确性、速度不是很好。网上有很多其他的方法和现成的包,你可以搜索看看。下面简单列举一个类
class LCS {
var $str1;
var $str2;
var $c = array();
/*返回串一和串二的最长公共子序列*/
function getLCS($str1, $str2, $len1 = 0, $len2 = 0) {
$this-str1 = $str1;
$this-str2 = $str2;
if ($len1 == 0) $len1 = strlen($str1);
if ($len2 == 0) $len2 = strlen($str2);
$this-initC($len1, $len2);
return $this-printLCS($this-c, $len1 - 1, $len2 - 1);
}
/*返回两个串的相似度*/
function getSimilar($str1, $str2) {
$len1 = strlen($str1);
$len2 = strlen($str2);
$len = strlen($this-getLCS($str1, $str2, $len1, $len2));
return $len * 2 / ($len1 + $len2);
}
function initC($len1, $len2) {
for ($i = 0; $i $len1; $i++) $this-c[$i][0] = 0;
for ($j = 0; $j $len2; $j++) $this-c[0][$j] = 0;
for ($i = 1; $i $len1; $i++) {
for ($j = 1; $j $len2; $j++) {
if ($this-str1[$i] == $this-str2[$j]) {
$this-c[$i][$j] = $this-c[$i - 1][$j - 1] + 1;
} else if ($this-c[$i - 1][$j] = $this-c[$i][$j - 1]) {
$this-c[$i][$j] = $this-c[$i - 1][$j];
} else {
$this-c[$i][$j] = $this-c[$i][$j - 1];
}
}
}
}
function printLCS($c, $i, $j) {
if ($i == 0 || $j == 0) {
if ($this-str1[$i] == $this-str2[$j]) return $this-str2[$j];
else return "";
}
if ($this-str1[$i] == $this-str2[$j]) {
return $this-printLCS($this-c, $i - 1, $j - 1).$this-str2[$j];
} else if ($this-c[$i - 1][$j] = $this-c[$i][$j - 1]) {
return $this-printLCS($this-c, $i - 1, $j);
} else {
return $this-printLCS($this-c, $i, $j - 1);
}
}
}
Q3: php根据相似度查找重复数据怎么实现?
1.首先,题主应该选一个相似度的计算维度,比如content字段,type字段等;
2.其次,题主考虑一下各个字段的权重,比如type字段必须相同,则让type字段使用typeWeight(例如赋值0.8)作为乘积的因子,而content字段本身是比较长的,所以需要计算出一个hash值,比如使用特定算法计算出一个hash值,然后把这个hash值按照16进制计算得到10进制数,再给一个权重contentWeight(例如0.2),另外再选取一个字段,比如description描述字段,再给一个权重descriptionWeight...
3.最后得到一个当前插入到表中的记录综合hash,typeWeight(contentHashcontentWeight+descriptionHash*descriptionWeight
+...),可能会涉及到大整数计算,不过PHP有BCMATH扩展可以使用,最终得到一个数值的综合hash值,保存到数据库的一个字段中,这个东西就可以理解为本条记录的特征值。
Q4: PHP如何计算两个字符串的相似度?
similar_text('my name is php', 'my name is java', $result);
var_dump($result);
参考链接:网页链接
Q5: php在数组中查询字符串相似度并返回键名或者键值
根据传入的字符串和数组,返回数组中相似度最高的字符串
PHP代码如下:
1.function closest_word($input, $words) {
2. $shortest = -1;
3. foreach ($words as $word) {
4. $lev = levenshtein($input, $word);
5. if ($lev == 0) {
6. $closest = $word;
7. $shortest = 0;
8. break;
9. }
10. if ($lev = $shortest || $shortest 0) {
11. $closest = $word;
12. $shortest = $lev;
13. }
14. }
15. return $closest;
16.}
2. 代码示例如下:
// 根据传入的州名(可能客户有输错),返回相似度最高的州名称
$united_state_list = array(
'AL'="Alabama",
'AK'="Alaska",
'AZ'="Arizona",
'AR'="Arkansas",
'CA'="California",
'CO'="Colorado",
'CT'="Connecticut",
'DE'="Delaware",
'DC'="District Of Columbia",
'FL'="Florida",
'GA'="Georgia",
'HI'="Hawaii",
'ID'="Idaho",
'IL'="Illinois",
'IN'="Indiana",
'IA'="Iowa",
'KS'="Kansas",
'KY'="Kentucky",
'LA'="Louisiana",
'ME'="Maine",
'MD'="Maryland",
'MA'="Massachusetts",
'MI'="Michigan",
'MN'="Minnesota",
'MS'="Mississippi",
'MO'="Missouri",
'MT'="Montana",
'NE'="Nebraska",
'NV'="Nevada",
'NH'="New Hampshire",
'NJ'="New Jersey",
'NM'="New Mexico",
'NY'="New York",
'NC'="North Carolina",
'ND'="North Dakota",
'OH'="Ohio",
'OK'="Oklahoma",
'OR'="Oregon",
'PA'="Pennsylvania",
'RI'="Rhode Island",
'SC'="South Carolina",
'SD'="South Dakota",
'TN'="Tennessee",
'TX'="Texas",
'UT'="Utah",
'VT'="Vermont",
'VA'="Virginia",
'WA'="Washington",
'WV'="West Virginia",
'WI'="Wisconsin",
'WY'="Wyoming"
);
$input_state = 'Wiscsin';
$state = closest_word($input_state ,array_values($united_state_list));
echo $state;
php数据库相似度的介绍就聊到这里吧,感谢你花时间阅读本站内容,更多关于php 文本相似度、php数据库相似度的信息别忘了在本站进行查找喔。







