首页 > 资讯 > 数据库 >如何使用Hanlp加载大字典

951

分享到

如何使用Hanlp加载大字典

2024-04-02 19:04:59 951人浏览八月长安

摘要

这篇文章将为大家详细讲解有关如何使用HaNLP加载大字典，小编觉得挺实用的，因此分享给大家做个参考，希望大家阅读完这篇文章后可以有所收获。　问题因为需要加载一个近 1G 的字典到Hanlp中，一开始使用了

这篇文章将为大家详细讲解有关如何使用HaNLP加载大字典，小编觉得挺实用的，因此分享给大家做个参考，希望大家阅读完这篇文章后可以有所收获。

　问题

因为需要加载一个近 1G 的字典到Hanlp中，一开始使用了CustomDictionay.add() 方法来一条条的加载，果然到了中间，维护DoubleArraTre 的成本太高，添加一个节点，都会很长时间，本来时间长一点没有关系，只要训练出.bin 的文件，第二次加载就会很快，然而作为以空间换时间的DAT结构，内存消耗很大，预料之内的出现了

out of memory: heap size

的问题。　后来尝试直接加载了1G 的字典，显然更不行。

思路

阅读了Hanlp的　部分源码，也请教了原作者一部分问题，　就打算从源码入手。初步想法大概是将原始字典

split 成多份，然后分别将多份的小字典训练成多个小的.bin 文件，再完整的加载到内存中，基于的原则则是：加载两个10M的字典的消耗比一个20M的要小。

然后又优化了一部分，现在加载一个大概1G的字典，占内存约3g+ ，已经可以使用了。

大概流程

修改　CustomDictionary.java　设置一个 HashMap　或者一个 list 来存储所有的小Dat

将所有的dat加载完，这里就不再区分主副字典了。

修改Segment.java里面的combineByCustomDictionary 函数，源码中只有一个dat，这里我们需要选择我们容器中其中某一个dat作为要匹配使用，之前使用的方案是，遍历所有的dat，知道有了匹配，但是这样缺陷很明显，解决不了多个字典匹配同一个词的字串的情况，这里我的考察方案是，字典中的同一个字开始的词条映射到同一个文件，这样不会出现字串问题了。

关于“如何使用Hanlp加载大字典”这篇文章就分享到这里了，希望以上内容可以对大家有一定的帮助，使各位可以学到更多知识，如果觉得文章不错，请把它分享出去让更多的人看到。

您可能感兴趣的文档:

--结束END--

本文标题: 如何使用Hanlp加载大字典

本文链接: https://lsjlt.com/news/64970.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

如何使用Hanlp加载大字典

如何使用Hanlp加载大字典

Hanlp如何使用Bug

ubuntu中hanlp如何使用

hanlp如何安装和使用

如何使用Python加载Git关键字？

Python中字典如何使用

如何向字典添加新键？

如何使用python合并字典

PHP 中的关键字加载：如何使用 NPM？

如何使用 NPM 加载 PHP 中的关键字？

PHP 中如何使用 NPM 的关键字加载？

MySQL中如何使用MDL字典锁

python如何使用字典get方法

python如何使用字典dict统计

Python字典和集合如何使用

如何加载web字体

Java中如何使用hanlp中文分词

Python如何向字典中添加元素

python如何往字典里添加数据

python如何往字典里添加内容

关于SQL建表语句使用详解

HBase在大数据审计与合规性追踪中的应用

MySQL与HBase在大数据金融分析中的性能与可扩展性对比

HBase的Region Server之间的网络通信优化

HBase在大数据监控与告警系统中的实时数据处理能力

MySQL与HBase在大数据安全策略中的实现与对比

HBase的分布式事务处理在复杂业务场景中的应用

MySQL与HBase在混合存储架构中的整合策略

HBase如何支持高效的二级索引查询

MySQL与HBase在物联网数据收集与处理中的协作模式