<optgroup id="g5t4d"><ruby id="g5t4d"><cite id="g5t4d"></cite></ruby></optgroup>
  • <delect id="g5t4d"><pre id="g5t4d"><big id="g5t4d"></big></pre></delect>
    <delect id="g5t4d"></delect><dl id="g5t4d"></dl>
    <dl id="g5t4d"></dl>
    <dl id="g5t4d"></dl>
    <dl id="g5t4d"></dl>

    <listing id="g5t4d"><pre id="g5t4d"></pre></listing>
  • 您的位置:首 頁 > 新聞中心 > 行業(yè)動態(tài) > 行業(yè)動態(tài)Python進行網(wǎng)頁文本處理

    行業(yè)動態(tài)

    行業(yè)動態(tài)Python進行網(wǎng)頁文本處理

    發(fā)布:2020-10-05 12:23:00 瀏覽:3713

           Python進行網(wǎng)頁文本處理。

           網(wǎng)頁文本中的中英文處理的區(qū)別在于中文需要額外加入分詞處理過程。所謂分詞就是將一段文本文字分成一個個詞組的過程。

           具體處理流程為:加載jieba分詞包進行中文分詞;將分詞后的詞組去掉停用詞及一個字符的詞后, 輸出訓(xùn)練文本中的常用分詞和熟悉的詞組;在訓(xùn)練文本的數(shù)據(jù)訓(xùn)練及情感詞典的歸檔中將爬取獲得的網(wǎng)頁數(shù)據(jù)的客觀性文本分詞后放入變量中, 主觀類情感文本放入另一變量中;為自動得到網(wǎng)頁文本中重要的關(guān)鍵詞組, 過濾掉對網(wǎng)頁文本意義貢獻不大的常用詞組, 在chi2模塊的特征選擇下, 采用詞頻-逆文本頻率 (TF-IDF) 概念將分詞詞組變量轉(zhuǎn)換為tf-idf向量形式, 輸出分詞向量矩陣, 為下一階段的網(wǎng)頁文本情感分析做準備。

    >>> 查看《行業(yè)動態(tài)Python進行網(wǎng)頁文本處理》更多相關(guān)資訊 <<<

    本文地址:http://www.finger78.cn/news/html/20623.html

    趕快點擊我,讓我來幫您!
    91精品久久久久久久无码,国产对白老熟女正在播放,亚洲色欲色欲综合网站sw0060,性色AV福利片
    <optgroup id="g5t4d"><ruby id="g5t4d"><cite id="g5t4d"></cite></ruby></optgroup>
  • <delect id="g5t4d"><pre id="g5t4d"><big id="g5t4d"></big></pre></delect>
    <delect id="g5t4d"></delect><dl id="g5t4d"></dl>
    <dl id="g5t4d"></dl>
    <dl id="g5t4d"></dl>
    <dl id="g5t4d"></dl>

    <listing id="g5t4d"><pre id="g5t4d"></pre></listing>