這篇文章主要介紹python爬蟲中lxml怎么使用?,文中介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們一定要看完!

首先我們利用它來解析 HTML 代碼,先來一個小例子來感受一下它的基本用法。
from lxml import etree text = ''' <div> <ul> <li><a href="link1.html">first item</a></li> <li><a href="link2.html">second item</a></li> <li><a href="link3.html">third item</a></li> <li><a href="link4.html">fourth item</a></li> <li><a href="link5.html">fifth item</a> </ul> </div> ''' html = etree.HTML(text) result = etree.tostring(html) print(result)
首先我們使用 lxml 的 etree 庫,然后利用 etree.HTML 初始化,然后我們將其打印出來。 其中,這里體現了 lxml 的一個非常實用的功能就是自動修正 html 代碼,大家應該注意到了,最后一個 li 標簽,其實我把尾標簽刪掉了,是不閉合的。不過,lxml 因為繼承了 libxml2 的特性,具有自動修正 HTML 代碼的功能。 所以輸出結果是這樣的
<html><body> <div> <ul> <li><a href="link1.html">first item</a></li> <li><a href="link2.html">second item</a></li> <li><a href="link3.html">third item</a></li> <li><a href="link4.html">fourth item</a></li> <li><a href="link5.html">fifth item</a></li> </ul> </div> </body></html>
不僅補全了 li 標簽,還添加了 body,html 標簽。
以上是python爬蟲中lxml怎么使用?的所有內容,感謝各位的閱讀!希望分享的內容對大家有幫助,更多相關知識,歡迎關注創新互聯行業資訊頻道!
                文章標題:python爬蟲中lxml怎么使用?-創新互聯
                
                網站鏈接:http://www.yijiale78.com/article48/dichep.html
            
成都網站建設公司_創新互聯,為您提供App設計、搜索引擎優化、云服務器、全網營銷推廣、移動網站建設、網站改版
聲明:本網站發布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網站立場,如需處理請聯系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經允許不得轉載,或轉載時需注明來源: 創新互聯