前言
透過 NFT Protal 出版 Writing NFT 時,我發現它的網頁爬蟲功能有一點點的不完美。
-
它有自己的一套機制去抓出網頁中的「文章內容」
這能有效降低檔案容量減少開銷,但機制並非100%適合所有網頁版型,而且就...不那麼美 -
外部連結資源並未上傳至
IPFS、Arweave ,這些資源從原始位置刪除掉就沒有了
如果你的圖片在不同的網址 (像Blogger預設就是),它們就是外部連結資源 -
外部連結的站台若有
CORS (Cross-Origin Resource Sharing)、CSP(Content Security Policy) 設定,或者圖片站台有
Hotlink Protection 功能,這些資源將無法被存取
我們的使用情境確實是 Cross Origin -
在頁面容量較大時會發生爬蟲失敗的狀況
(爬蟲功能關係到後端主機的負載,不可能無限制的爬,這是很合理的狀況)
總而言之,我的網頁變成了這個樣子
ar://6tpNpIuUvMgu-KXkFHm_0BnoyUEjKGGwQvklZ1-dk8k
ar://CgOW561bpnJd_1ce9yVm7XCFGamn9BZm9JYry1PPSbM
這篇文章會說明如何自行爬蟲下來完整的網頁 html 存檔,再以此來制作 Writing NFT。


