上周开发了一个磁力链接和 BT 种子的搜索引擎 {Magnet & Torrent},本文简单介绍一下主要的系统功能和用到的技术。
系统包括几个独立的部分:
使用 Python 的 Scrapy 框架开发的网络爬虫,用来爬取磁力链接和种子;
使用 PHP CI 框架开发的简易网站;
搜索引擎目前直接使用的 MySQL,将来可以考虑使用 sphinx;
-
中文分词。
用 PHP 写了一个简陋版的基于逆向最大匹配算法的小类,词库呢,哈哈,直接使用了 Chrome 的分词表,分词表可以在这个地址下载:http://www.mdbg.net/chindict/chindict.php?page=cedict。
-
新词发现机制
基于搜索关键词的新词发现机制。
目前词库方面还有一个很大的问题,比如最新的电影无法分词,例如星际穿越 会被分词为“星际”和“穿越”,因此“被偷走的那五年,穿越火线

本文介绍了开发一个磁力链接和BT种子搜索引擎的过程,包括使用Python Scrapy爬虫抓取数据,PHP CI框架构建网站,MySQL存储数据,并探讨了中文分词、新词发现、资源别名、英文分词以及DHT网络爬虫的工作原理。通过DHT网络监听,被动获取热门种子信息,提高了搜索引擎的效率和准确性。
863

被折叠的 条评论
为什么被折叠?



