“学长,今后语义识别肯定会进入NLP时代,这个方向,毋庸置疑。”
“但现在,路径不对。”
Robin抬头看着余江,示意他继续。
只见余江微微一笑:“你们现在是不是双向最大词典匹配分词?正向扫一遍、逆向扫一遍,拼词典凑结果,同时不断增加词典。”
“但遇到NJ市长江大桥这种情况还是很烦,对吧?”
Robin瞬间愣住,深深地看了余江一眼。
“你研究过?”
“我猜的。”
Robin眉头皱起,显然不信。
余江微笑道:“学长,这样吧,你也别买我的导航网站了……我接入你们的搜索,但不管我这边搜索量多大,你都不收我的钱……而且今后有了盈利模式,你都不能把i123抛开,利润我们五五开,怎么样?”
Robin再次一怔:“这是你答应加入百度的条件?”
“不,是我帮你在现有条件下,解决分词困境的条件。”
Robin的眼睛瞬间睁大!
他几乎强忍着才没又站起身来。
听他的意思?是他刚才想了那么一会,就想到解决分词问题的方向了?
Robin几乎是惊恐地盯着他:“你别告诉我,你刚才那一会,就想到了更好的分词技术?”
“刚才想了想……应该没问题。”
Robin以为自己见鬼了。
但当看到对面那自信坦然的神色时候,他瞬间告诉自己,要冷静,别犯蠢。
深呼吸数下后,他迅速评估了i123的流量,又评估了分词技术的重要性。
片刻后,Robin深深吸气,又缓缓点头。
“只要你能解决,我答应你!”
余江也痛快点头:“申请专利,我只要一半就行。”
Robin沉声道:“可以!如果真解决,我给你专利费!”
余江当下再不墨迹,伸手拿过一张用了一半的A4纸,翻到背面,直接落笔。
——统计语言模型
——马尔可夫链式假设
——2-Gram
——P(wn∣w1,w2...wn?1)=P(wn∣wn?1)
——3-Gram
——P(wn∣w1,w2...wn?1)=P(wn∣wn?2,wn?1)
——P(w2∣w1)=Count(w1w2)/Count(w1)
……
“……统计全网语料,数w1后面紧跟 w2出现多少次,除以 w1单独出现多少次。譬如‘NJ市长江大桥’,‘南京’后面跟‘市’概率极高,‘市长’后面跟‘江’的概率无限趋近 0,直接消除歧义。”
余江一边写着,一边介绍。
Robin早已起身,他扶着床架,眼睛仿佛要掉进纸里。
宿舍里一片安静。
李茂低头认真看书,林应松保持动作不变,只是眼睛间或快速扫一遍,周宇几个人更是头也不抬。
都在假装很忙。
小余哥说的,已经超越了他们的知识边界。
余江盯着草稿纸:“我再想想。”
“……最后再加入拉普拉斯平滑。”
余江瞥了一眼Robin,快速写下最后一个公式。
——P(w3∣w1w2)=[Count(w1w2w3)+1]/[Count(w1w2)+V]。
“学长,不需要我把完整代码也写上吧?”
说完后,余江将A4纸递到Robin面前。
Robin猛地一个激灵!
他如梦初醒,瞬间抓过A4纸。
“你……是在刚才想到的?!”
“我总不能算到学长要过来吧?”
余江耸了耸肩,站起身来。
他退到对面的床边,嘴角浮起笑意。