Sphinx全文索引 第一节

Posted 云旗

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Sphinx全文索引 第一节相关的知识,希望对你有一定的参考价值。


1 使用场景:用来解决站内搜索的一些应用场景。

网站中的搜索(站内搜索)
系统后台中的搜索

第一种方式:php——>mysql
第二种方式:MySQL<——>Sphinx;PHP——>Sphinx。


MySQL全文索引引擎也可以解决站内搜索,当数据库某张表数据量大的时候,做搜索花费时间多。
MySQL:添加索引 alert table 表名 add index 随便起索引名字(字段)

Sphinx将mysql数据生成一个索引数据表供前台检索可以提高检索效率。



2 Sphinx

Sphinx是一个基于SQL的全文检索引擎,可以结合MySQL,PostgreSQL做全文搜索,它可以提供比数据库本身更专业的搜索功能,使得应用程序更容易实现专业化的全文检索。

Sphinx特别为一些脚本语言设计搜索API接口,如PHP,Python,Perl,Ruby等,同时为MySQL也设计了一个存储引擎插件。
Sphinx 单一索引最大可包含1亿条记录,在1千万条记录情况下的查询速度为0.x秒(毫秒级)。

Sphinx创建索引的速度为:
创建100万条记录的索引只需 3~4分钟,创建1000万条记录的索引可以在50分钟内完成,而只包含最新10万条记录的增量索引,重建一次只需几十秒。

Sphinx的主要特性包括:

高速索引 (在新款CPU上,近10 MB/秒); 
高速搜索 (2-4G的文本量中平均查询速度不到0.1秒); 
高可用性 (单CPU上最大可支持100 GB的文本,100M文档); 
提供良好的相关性排名 支持分布式搜索; 提供文档摘要生成; 
提供从MySQL内部的插件式存储引擎上搜索 支持布尔,短语, 和近义词查询; 
支持每个文档多个全文检索域(默认最大32个); 
支持每个文档多属性; 
支持断词; 
支持单字节编码与UTF-8编码;

 



3 两个重要的工具indexer 和 searched

indexer:用于创建索引数据

/user/bin/indexer -config /etc/sphinxsearch/sphinx.conf -all

 



searched:后台进程,使用indexer工具生成的数据做查询

4 索引文件存储的数据种类

.spa 存储文档属性
.spd 存储每个词ID可匹配的文档ID列表
.sph 存储索引头信息
.spi 存储词列表
.spm 存储MVA数据
.spp 存储每个词的命中列表

 

5 查看sphinx数据

sphinx进入mysql的命令:

mysql -h0 -p9306(sphinx与数据库交互的端口号)

 


以上是关于Sphinx全文索引 第一节的主要内容,如果未能解决你的问题,请参考以下文章

Sphinx 死文克斯 联合Mysql实现中文全文索引

Sphinx全文索引

全文索引Sphinx+binlog日志+Grant用户授权+读写分离和主从复制

Lucene Sphinx 全文索引 对比

全文检索:sphinx elasticsearch xunsearch 比较

php+中文分词scws+sphinx+mysql打造千万级数据全文搜索