一区二区三区三上|欧美在线视频五区|国产午夜无码在线观看视频|亚洲国产裸体网站|无码成年人影视|亚洲AV亚洲AV|成人开心激情五月|欧美性爱内射视频|超碰人人干人人上|一区二区无码三区亚洲人区久久精品

您好,歡迎來電子發(fā)燒友網(wǎng)! ,新用戶?[免費注冊]

您的位置:電子發(fā)燒友網(wǎng)>源碼下載>數(shù)值算法/人工智能>

面向流式數(shù)據(jù)的增量式字符串相似性連接方法

大?。?/span>0.87 MB 人氣: 2017-12-25 需要積分:2

  字符串相似性連接是數(shù)據(jù)質(zhì)量管理的基本操作,也是數(shù)據(jù)價值發(fā)現(xiàn)的關鍵步驟。針對目前已有的方法不能滿足面向大數(shù)據(jù)的增量式處理需求的問題,提出一種面向流式數(shù)據(jù)的增量式字符串相似性連接方法-Inc-Join,并對方法的索引技術進行了優(yōu)化。該方法以Pass-Join字符串連接算法為基礎,首先,采用字符串劃分技術將字符串劃分成多個互不相交的子串;然后,建立字符串的反向索引列表并將其作為狀態(tài);最后,新增數(shù)據(jù)只需根據(jù)狀態(tài)進行相似性計算,每次連接操作結束后都對狀態(tài)進行更新。實驗結果表明,Inc-Join方法在不影響連接準確率的同時,有效將長、短字符串重復匹配次數(shù)減少為根號n(n是批處理方式的匹配次數(shù))。實驗對3種數(shù)據(jù)集進行處理,發(fā)現(xiàn)使用批處理方式進行相似性連接的響應時間是Inc-Join的1至4.7倍,并呈現(xiàn)急劇遞增的趨勢;而且優(yōu)化后Inc-Join方法的響應時間最小只占優(yōu)化前的3/4,并隨處理數(shù)據(jù)的增多所占比例越來越小。同時優(yōu)化后的Inc-Join不需要保存狀態(tài),再一次減小了算法執(zhí)行的時間和空間開銷。

面向流式數(shù)據(jù)的增量式字符串相似性連接方法

非常好我支持^.^

(0) 0%

不好我反對

(0) 0%

      發(fā)表評論

      用戶評論
      評價:好評中評差評

      發(fā)表評論,獲取積分! 請遵守相關規(guī)定!

      ?