Lucene.Net 2.3.1开发介绍 —— 三、索引(六)

Lucene.Net 2.3.1开发介绍 —— 三、索引(六)

原文:
Lucene.Net 2.3.1开发介绍 —— 三、索引(六)

2.2 Field的Boost

如果说Document的Boost是一条线,那么Field的Boost则是一个点。怎么理解这个点呢?设置Document的Boost会影响所有字段。在搜索的过程中,一般至少会搜索两个Field,比如同时搜索标题和内容。而Document的Boost将同时影响标题和内容的搜索得分,但是设置Field的Boost则不会有那么大的影响,Field的Boost只会影响一个点。那这个点有什么用呢?

 

现在来做个假设,假设,现在有一条记录是关于Lucene的,这篇文章讲得很好,我想要让别人搜索Lucene这个关键字的时候,这条记录一定排在前10。怎么办?设置Docuement的Boost?设置得还很高?OK!这篇文章里面也有其他关键字,比如”asp.net”,”Sql Server”。现在搜索”asp.net”,发现这篇文章也跑到前10了。这可不是我想要的。

 

怎么办呢?

 

现在有两个解决办法,一个就是冗余一个Field,里面记录了Tag一类的东西,给这篇文章设置Tag值为“Lucene”,同时在索引tag字段的时候把它的Boost调高。比如代码2.2.1,在添加完文档后把该文档的tag这个Field Boost设置为想要的。

 

Lucene.Net 2.3.1开发介绍 —— 三、索引(六)
Lucene.Net 2.3.1开发介绍 —— 三、索引(六)
代码2.2.1

 1Lucene.Net 2.3.1开发介绍 —— 三、索引(六)Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/**//// <summary>
 2Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// 添加文档
 3Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// </summary>
 4Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// <param name=”writer”>维护文档管理器</param>
 5Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// <param name=”title”>标题</param>
 6Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// <param name=”content”>内容</param>
 7Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// <param name=”tag”>tag</param>
 8Lucene.Net 2.3.1开发介绍 —— 三、索引(六)/// <param name=”boost”>tag的boost</param>

 9Lucene.Net 2.3.1开发介绍 —— 三、索引(六)void AddDocument(IndexWriter writer, string title, string content, string tag, float boost)
10Lucene.Net 2.3.1开发介绍 —— 三、索引(六)Lucene.Net 2.3.1开发介绍 —— 三、索引(六)Lucene.Net 2.3.1开发介绍 —— 三、索引(六){

11Lucene.Net 2.3.1开发介绍 —— 三、索引(六)    Document document = new Document();
12Lucene.Net 2.3.1开发介绍 —— 三、索引(六)    document.Add(new Field(title, title, Field.Store.YES, Field.Index.TOKENIZED));
13Lucene.Net 2.3.1开发介绍 —— 三、索引(六)    document.Add(new Field(content, content, Field.Store.YES, Field.Index.TOKENIZED));
14Lucene.Net 2.3.1开发介绍 —— 三、索引(六)    document.Add(new Field(tag, content, Field.Store.YES, Field.Index.TOKENIZED));
15Lucene.Net 2.3.1开发介绍 —— 三、索引(六)    document.GetField(tag).SetBoost(boost);
16Lucene.Net 2.3.1开发介绍 —— 三、索引(六)    writer.AddDocument(document);
17Lucene.Net 2.3.1开发介绍 —— 三、索引(六)}

 

 

当然,这样处理不是很好,一来,增加一个字段,给维护上带来难度,而且很多好文章没tag怎么办,再有就是非站内搜索呢?另一种办法就是设置一个字数相对较少的字段,调高它的Boost。

 

比如,我现在把Title这个字段的Boost调成1.3,也就是说我搜索的时候,title的权重要比content的高,那么当我标题中含有Lucene的时候,得分总是会偏高,那样,就可以把记录调到前面去了。这里千万不要调高content,如果全部调的话影响也不是太大,但是对于搜索整体的质量有很大影响。为什么这么说呢?因为如果标题里含有一个keyword “a”,那么这篇文章一般有关于这个“a”的内容,但是如果内容里含有“a”而标题没有,非常多的文章实际上都不是讲“a”的。

 

2.3 怎么有效调整得分

 

这里只是我的一些调整的经验,其实想一想也就明白了,没什么深奥的。

 

(1)、首先,标题的权重一定比内容的要高;

(2)、根据实际情况调整权重;

          比如,现在要索引论坛的内容,那完全可以设置内容很少的帖子权重非常低,这个时候直接设置Document的权重就行了;而如果这个帖子的回复或者访问量  又非常高,那么每个回复或者浏览量,给加0.01的基数,让这个总体量不超过0.2;要是这个帖子是精华贴呢?直接加上0.1吧。

          实际的调整过程就是你把各种问题想想全面就好了。

(3)、如果要把一个文档的Document的Boost调得非常高,比如调整成2,那么千万要注意,减少它的内容,内容中出现的词越少越好;

          比如,像baidu那种的做个广告,那么就在里面放一个商家买的关键词就行了,其它什么也不要。

(4)、宁可设置Field,比设置Document来得好,设置的方法就不用说啦。

 

要注意的是,越短的帖子,越要降低它的权重。比如它只有两个字,怎么也要把它的权重调到0.1一下。为什么?因为两个字一般是一个词,这个词如果被搜索,得分就是1,你不调?那不是让水贴浮到最上层了么?

 

以上都是些经验之谈,大家可以结合实际情况自己做一些调整。经验主义,有错误和不足的地方,大家多包涵,指正,呵呵。

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 举报,一经查实,本站将立刻删除。

发布者:全栈程序员-用户IM,转载请注明出处:https://javaforall.cn/109407.html原文链接:https://javaforall.cn

【正版授权,激活自己账号】: Jetbrains全家桶Ide使用,1年售后保障,每天仅需1毛

【官方授权 正版激活】: 官方授权 正版激活 支持Jetbrains家族下所有IDE 使用个人JB账号...

(0)
blank

相关推荐

  • 如何保证docker2375端口的安全

    如何保证docker2375端口的安全情景再现:之前有很多朋友提过,当使用docker-maven-plugin打包SpringBoot应用的Docker镜像时,服务器需要开放2375端口。由于开放了端口没有做任何安全保护,会引起安全漏洞,被人入侵、挖矿、CPU飙升这些情况都有发生,今天我们来聊聊如何解决这个问题。问题产生的原因首先我们要明白问题产生的原因,才能更好地解决问题!Docker为了实现集群管理,提供了远程管理的端口。DockerDaemon作为守护进程运行在后台,可以执行发送到管理端口上的Docker命令。当我们修改do

  • Ubuntu 下安装 GCC 的方法[通俗易懂]

    Ubuntu 下安装 GCC 的方法[通俗易懂]1.更新Ubuntu执行下面命令:$sudoaptupdate结果更新老是失败,于是把etc\apt\sources.list文件中的数据源修改成国内站点,才搞定:debhttps://mirrors.tuna.tsinghua.edu.cn/ubuntu/bionicmainrestricteduniversemultiversedebhttps://mirrors.tuna.tsinghua.edu.cn/ubuntu/bionic-updatesmainre

  • mysql远程连接及用户相关命令

    一、创建用户并授权登录root:root@localhost:~#mysql-uroot-p创建username(用户)使用password(密码)从任何主机连接到mysql服务器:mysql&gt;GRANTALLPRIVILEGESON*.*TO’username’@’%’IDENTIFIEDBY’password’WITHGRANTO…

  • pycharm gitee_pycharm上传代码到github

    pycharm gitee_pycharm上传代码到github1.查看git日志2.文件更改添加一部分信息后文件会变蓝新创建一个文件夹会提问要不要加入到Git中如果选择cancel文件夹会继续是红色的然后不加到Git仓库选择add则文件名变绿3.提交更改左键双击可以查看更改的具体信息填写提交的备注信息然后点击commit可以看到文件颜色消失下面是未push时的截图然后输入账号密码可以看到提交成功…

  • javaweb-maven-2-59

    javaweb-maven-2-59

  • 非常好用的上位机软件(功能强大)——匿名四轴上位机「建议收藏」

    非常好用的上位机软件(功能强大)——匿名四轴上位机「建议收藏」提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档文章目录前言 一、pandas是什么? 二、使用步骤 1.引入库 2.读入数据 总结前言随着单片机开发,调试工具就必不可少,本文就介绍匿名四轴上位机的基础知识。提示:以下是本篇文章正文内容,下面案例可供参考一、什么是上位机上位机是指可以直接发出操控命令的计算机,一般是PC/hostcomputer/mastercomputer/uppercomputer,屏幕上显示各种信号变化(.

发表回复

您的电子邮箱地址不会被公开。

关注全栈程序员社区公众号