深网,即深層網站(),是指不能被标准搜索引擎索引的全球資訊網内容。與深網對比的術語是表網,任何人都可以使用網際網路存取。
深網可以直接透過的URL或IP位址存取,但可能需要輸入密碼或其他安全資訊才能閱覽實際內容。深層網站的應用包括網路郵件、網路銀行、限制存取的社群媒體頁面和個人資料,以及需要註冊才能閱覽內容的網路論壇。此外,深網也包含付費服務,例如隨選視訊、網路雜誌和報紙等。
名詞
2009年,深網與暗網這兩個名詞開始發生混淆,當時深網與自由網和黑暗網路上發生的非法活動被一同討論。這些犯罪活動包括個人密碼、偽造身份證件、毒品、槍枝和兒童色情交易。
從那時起,在媒體報導黑市網站絲綢之路時,深網一詞經常被媒體與暗網或黑暗網路混為一談。然而,這種比較被一些人認為是不準確的,並因此導致了長期的混亂。Wired記者Kim Zetter和Andy Greenberg建議這兩個術語應該區分使用。深網是指無法利用傳統搜尋引擎存取的任何網站,而暗網則是被刻意隱藏並且無法利用一般瀏覽器和方法進入。
命名
伯格曼在The Journal of Electronic Publishing上發表一篇關於深网的重大論文中提到,吉尔.艾尔斯沃夫曾经使用“隱形網”这一术语表示那些没有被任何搜索引擎索引注册的网站:
这些网站可能已经被合理地设计出来了,但是他们却没有被任何搜索引擎编列索引,以至于事实上没有人能找到他们。我可以这样对这些不可见的网站说,你们是隐藏了的。我稱之為隱形網。
早期另一個使用“隱形網”这一术语的是一家叫做“个人图书馆软件”公司的布鲁斯·芒特和马修·B·科尔,当他们公司在1996年12月推出和发行的一款软件时,他们对深网工具的有过这样的一番描述。
現在普遍接受的深网這一特定術語首次使用在2001年伯格曼的研究中。
深網資源
防止網頁被傳統搜索引擎索引的方法可以被分類為以下一個或多個:
被限制存取的內容:以技術方式限制訪問其網頁的網站,例如robots.txt、CAPTCHAs或是禁止搜尋引擎建立快取。
非HTML或文本的內容:圖像或影片等多媒體或是特定檔案格式無法被搜尋引擎處理。
私人網站:需要註冊或是登入的網站。
軟體:某些內容刻意隱藏在一般的網路上,只能使用特殊軟體如Tor、I2P或其他程式存取。例如Tor讓使用者匿名訪問.onion網址的網站,以隱藏他們的IP位址。
未被連結的內容:未被其他網站連結或很少連結的網頁,這可能防止被網路爬蟲存取。
網站檔案管理庫:網站時光機這類網站內容的網頁無法被搜尋引擎編入索引。
抓取深網內容
研究人员探寻了如何自动抓取深网内容。
2001年,斯利拉姆·拉格哈瓦(Sriram Raghavan)和赫克托·加西亞·莫利納(Hector Garcia-Molina)发明了一个从用户请求界面表格收集关键词的深网抓取模型并且抓取深网资源。加利福尼亚大学洛杉矶分校的Alexandros Ntoulas、Petros Zerfos和Junghoo Cho创建了一个自动生成有意义的查询词的程序。
商业搜索引擎已经开始使用以上两种方法之一抓取深网。Sitemap協議(由Google於2005年首次開發並由Google引入)和mod oai是允许搜索引擎和其他网络服务探索深网解决方法。以上两种解决方法允许网络服务主动公布网址,这对于他们来说是容易的,因而允许自动探寻资源而不直接通过网络表面的链接。Google的深网探寻系统预先计算每个HTML表单并且添加结果HTML页面到Google搜索引擎索引。在这个系统里,使用三种方法计算提交词:
为输入搜索选择关键词允许的输入值,
确定是否只接受特定的值(例如时间),以及
选择少量的组合生成适合纳入网站的搜索索引网址。
2008年,為了方便Tor隱藏服務的使用者存取和搜尋隱藏的.onion網域,亞倫·斯沃茨設計了Tor2web—一個能夠利用普通瀏覽器存取的代理應用程序。
参見
*暗网
参考资源
评论 (0)