使用Solr构建企业级的全文检索 - W3CAPI 在线教程

换了个工作单位，也就换了从事的项目的业务类型。新的项目中要需要使用全文检索功能，由于项目是基于SQL server的应用，所以旧的设计也就使用了SQL server的Full-text Search Engine来实现全文检索功能。在使用SQL server 的全文检索功能的过程中，发现有很多的问题不能很好的解决，比如Cache,一般来说，对于SQL server的缓存也就是执行计划的缓存和查询结果的页面缓存，远远不够，而且也很难根据自己的业务需要去调整缓存的参数。另外对于多语言的分词算法问题，SQL server虽然内置了50多种语言的支持，但是都不够完美，如果自己想要进行替换，应该是很困难的。还不支持Highlighting，还有现在应用很广泛的Faceting以及Field Collapsing。客户推荐我们使用一下Solr来改进全文检索功能，所以我就花了些时间来研究了下Solr，并打算写一些文章总结一下Solr的使用，也希望对各位同学有帮助吧。

唧唧歪歪说了一堆，现在就进入正题吧。

首先介绍一下Solr是什么。要说Solr，先说说Lucene。Lucene是Apache基金会一个全文检索库类库的项目，这个项目的开源的，这个类库是使用Java开发的，功能非常强大，如果大家感兴趣可以去看看http://lucene.apache.org/.当然这个类库也有几个其它语言的实现，比如Python，也有.net的叫做lucene.net，不过因为社区活跃度不高，Apache基金会已经不再赞助这个子项目了。如果哪位同学希望把全文检索的功能集成在自己的系统里面，或者扩展luence的全文检索功能，那应该好好学学Lucene。如果你只想使用全文检索，对底层的算法和逻辑既不想研究也不想干预，那么Solr可能是一个更好的选择。简单的说，Solr就是使用Lucene库实现的一个http服务，当然他也做了很多的扩展。你可以将Solr部署在任何一个Java Serverlet容器里，比如Tomcat，Jetty。你可以通过RESTful的url就可以和Solr进行通信，进行文档的indexing和检索。这样一来，易用性就得到大大的提升，因为不管你的项目是基于什么操作系统平台的，使用什么语言开发的，只要你能和http服务器进行通信，就能非常简单快捷的在你的项目中实现全文检索功能。如果要更加详细的谅解Solr的相关信息，请访问：http://lucene.apache.org/solr/

接下来我们需要下载和部署Solr。从 http://mirror.bjtu.edu.cn/apache//lucene/solr/这个页面里选择下载最新的版本，目前是3.5.0，刚刚出炉的。在安装前有几个准备工作要做。Solr是用Java实现的，所以毫无疑问Java的虚拟机是要的，不管你是在Window上安装，还是在Linux上安装，点击这里下载JDK，安装完JDK别忘了检查JAVA_HOME环境变量是否设置了。另外，如果你打算使用Tomcat的话，那就得先安装Tomcat，点击这里了下载。其实在实践和练习的时候是用Jetty是比较方便的。如果你在windows上使用Solr，那么把刚才下载的Solr文件包加开，使用dos 命令行控制台进入example目录，输入java -jar start.jar,然后回车，如果没有什么异常信息，Solr就启动起来了。现在你打开浏览器，输入http://localhost:8983/solr/admin/，就可以进入Solr的管理控制台了，如下图

简单的安装已经完成，可以进行文档索引和查询了。

今天的开篇就到这里吧，算是准备了一个环境。后续我会写一系列文章来介绍Solr的使用。

在提供一些对大家准备环境有帮助的信息：

Solr client for .Net --google code上的项目，项目的负责人很积极，如果你提交了Issue或者Defect，他会持续的关注和反馈。