设为首页 收藏本站
查看: 771|回复: 0

[经验分享] viterbi算法 python版

[复制链接]

尚未签到

发表于 2017-4-29 09:34:28 | 显示全部楼层 |阅读模式
  牛mm细心给我讲了一个小时,终于明白它的含义,然后花了一两节分布式数据库的课实现了。当时牛mm还说不可能这么快实现,结果不可能事还是发生了。发现python果真非常好用。不明白此算法可以看这篇blog http://blog.csdn.net/NirvanaFeng/archive/2009/05/12/4171799.aspx
  初始化方法:
  def InitDicForViterbi(nodes,posw,posdi,n):newWordList = []# 解决未登录词for i in nodes:if not posw.has_key(i):newWordList.append(i)maxPosList = NPos(posdi,n)print maxPosListGenerateDicPos(newWordList,maxPosList,posw,posdi)def InitViterbi(node,posw,posdi):viStatePath = []for i in posw[node]:if i <> "@@@":print "i:",iviStatePath.append([posw[node]*posdi["@@@"],])return viStatePath
  viterbi算法函数
  """ nodes 就是分好的词, posw 是词转换为词性的概率,posdi是词性之间的转换概率,n 是n个最大的词性将此用于未登录词中,weightNone是未出现的词性转移的概率nodes format {word1,word2...} , posw format {word1:{pos1:fre,pos2:fre,..."@@@":totalnum},..."@@@":total}posdi format {pos1:{pos2:fre,pos3:fre...."@@@":total},...."@@@":total}"""def Viterbi(nodes,posw,posdi,n,weightNone):InitDicForViterbi(nodes,posw,posdi,n)viStatePath = InitViterbi(nodes[0],posw,posdi)length = len(nodes)currentNode = 1while currentNode < length:currentPosList = posw[nodes[currentNode]]paths = []# print "vstate:",viStatePathfor k in currentPosList:if k <> "@@@":ajk = weightNoneheap = []for j in xrange(len(viStatePath)):# compute every state j to every state k in ti#          temppath = viStatePath[j]#           print "lastpos:",temppathlastpos = viStatePath[j][1][-1]lastweight = viStatePath[j][0]lastposList = posdi[lastpos]if lastposList.has_key(k):ajk =lastposList[k]currentweight = lastweight * ajk * currentPosList[k]#            print "viStatePath:",viStatePath[j][1]pathNew = [data for data in viStatePath[j][1]]pathNew.append(k)#             print "pathNew:",pathNewheappush(heap,[currentweight,pathNew])# get the max possibility of state k in ti#          print "path:",pathpaths.append(nlargest(1,heap)[0])del viStatePathviStatePath = paths#    print "paths:",pathscurrentNode = currentNode + 1heap = []# get the max possibility pathfor i in viStatePath:heappush(heap,i)return nlargest(1,heap)
  结果打印输出函数:
  """nodes format {word1,word2,...} path is [weight,[pos1,pos2....]]"""def Result(nodes,path,edcode="utf-8"):realPath = path[0][1]ResultPrint(nodes,realPath,edcode)"""nodes format {word1,word2,...} path is [pos1,pos2....]"""def ResultPrint(nodes,path,edcode="utf-8"):for i in xrange(len(nodes)):print nodes.decode(edcode),"/",path.decode(edcode)
  下面是测试代码:
  aa = ConvertGBKtoUTF("球球")    bb = ConvertGBKtoUTF("娃娃")cc = ConvertGBKtoUTF("吃饭")dd = ConvertGBKtoUTF("好")ee = ConvertGBKtoUTF("dddwieoewkem")dictions = {aa:{bb:1,"@@@":4},bb:{cc:2,aa:3,"@@@":40},"@@@":400}posdi = {"n":{"s":3,"v":3,"@@@":40},"s":{"v":2,"e":3,"@@@":33},"v":{"@@@":1},"@@@":100}posw = {aa:{"n":1,"v":3,"@@@":29},bb:{"n":1,"s":1,"@@@":19},cc:{"n":1,"@@@":1},"@@@":10002}nodes = [aa,bb,cc,ee,dd,bb,aa,cc]path = Viterbi(nodes,posw,posdi,3,0.01)print pathResult(nodes,path)
  这里不要问为啥要encode,然后再decode 因为只有这样才能在屏幕上打印出中文。

运维网声明 1、欢迎大家加入本站运维交流群:群②:261659950 群⑤:202807635 群⑦870801961 群⑧679858003
2、本站所有主题由该帖子作者发表,该帖子作者与运维网享有帖子相关版权
3、所有作品的著作权均归原作者享有,请您和我们一样尊重他人的著作权等合法权益。如果您对作品感到满意,请购买正版
4、禁止制作、复制、发布和传播具有反动、淫秽、色情、暴力、凶杀等内容的信息,一经发现立即删除。若您因此触犯法律,一切后果自负,我们对此不承担任何责任
5、所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其内容的准确性、可靠性、正当性、安全性、合法性等负责,亦不承担任何法律责任
6、所有作品仅供您个人学习、研究或欣赏,不得用于商业或者其他用途,否则,一切后果均由您自己承担,我们对此不承担任何法律责任
7、如涉及侵犯版权等问题,请您及时通知我们,我们将立即采取措施予以解决
8、联系人Email:admin@iyunv.com 网址:www.yunweiku.com

所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其承担任何法律责任,如涉及侵犯版权等问题,请您及时通知我们,我们将立即处理,联系人Email:kefu@iyunv.com,QQ:1061981298 本贴地址:https://www.yunweiku.com/thread-370637-1-1.html 上篇帖子: Python学习笔记(三) 下篇帖子: python计算24点
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

扫码加入运维网微信交流群X

扫码加入运维网微信交流群

扫描二维码加入运维网微信交流群,最新一手资源尽在官方微信交流群!快快加入我们吧...

扫描微信二维码查看详情

客服E-mail:kefu@iyunv.com 客服QQ:1061981298


QQ群⑦:运维网交流群⑦ QQ群⑧:运维网交流群⑧ k8s群:运维网kubernetes交流群


提醒:禁止发布任何违反国家法律、法规的言论与图片等内容;本站内容均来自个人观点与网络等信息,非本站认同之观点.


本站大部分资源是网友从网上搜集分享而来,其版权均归原作者及其网站所有,我们尊重他人的合法权益,如有内容侵犯您的合法权益,请及时与我们联系进行核实删除!



合作伙伴: 青云cloud

快速回复 返回顶部 返回列表