要從 Google Sheets 中一整欄的超連結抽出所有網址,請將檔案另存為 HTML,用文字編輯器開啟該 HTML 檔,然後解析其中的 anchor 標籤——Google Sheets 會將每個連結寫成一個 元素,所以目標網址就在標記裡直接可見。連結抽取器正是對貼上的原始碼執行這樣的掃描:它會走訪 HTML,從每個 href 值中取出 a、area 和 link 的起始標籤內容,進行正規化、移除重複,然後回傳每行一個網址的結果。您可以將這份清單複製到另一欄、CSV 檔,或第二張工作表以進行後續處理。解析過程完全在本機執行,工具本身絕不會向列出的目標網址發送請求,而產出的是一份快照,只要來源變更就能隨時重跑。因為掃描遵循一組有限且有文件記載的規則,輸出只反映解析器從來源抽出的內容,這讓工作流程在多張工作表之間很容易重現。
當內建的 =HYPERLINK() 函式沒辦法給出您需要的結果、當網址是別人從其他文件複製貼上到儲存格時、或當您需要一次稽核一長串出站連結時,這個方法就很實用。兩種常見的試算表技巧——一個一個懸停並複製連結,或是寫一段 Apps Script 來讀取每個儲存格——不是無法擴展,就是需要線上工作表的權限。解析匯出的 HTML 則能套用於任何可下載的試算表,完全不需動到正在運作的檔案,當工作表是共用的、唯讀的或屬於另一個帳號時,這點特別有用。

為何 HTML 匯出檔帶有真實的 Href
在 Google Sheets 中選擇檔案 → 下載 → 網頁 (.html, 壓縮)時,平台會產生一個壓縮資料夾,內含單一代表目前工作表的 HTML 檔。該工作表中的每個超連結,包含使用 =HYPERLINK() 建立的,以及 Google 自動偵測到貼上網址所產生的,都會變成帶有 href 屬性的 標籤。匯出的檔案也會將樣式表與圖示的參照以 元素的形式帶進來,抽取器會一併抓取,因為它會掃描這三種帶連結的起始標籤,而不僅只處理 anchor。影像地圖的 元素也是基於同樣的原因而被納入。
結果就是一份自給自足的快照:工作表的資料、它的連結,以及瀏覽器原本會用來呈現頁面的資源,全部以純文字存在。這使得檔案易於檢查、易於版本控管,也易於餵給解析器。由於解析器是讀取原始碼而非實際渲染檔案,您不需要瀏覽器、伺服器或外掛——只需要一個文字編輯器把標記複製出來,再交給連結抽取器進行解析即可。
如何從 Google Sheets 超連結抽出連結
- 在 Google Sheets 中選擇檔案 → 下載 → 網頁 (.html, 壓縮)。檔案會以工作簿命名的 zip 封存檔形式下載到您的下載資料夾。
- 解壓縮該封存檔。裡面會找到一個 HTML 檔(通常以工作表命名),以及一個放著樣式表、圖片等支援資源的資料夾。請用任何純文字編輯器開啟該 HTML 檔。
- 在 Windows 上用 Ctrl+A,或在 macOS 上用 Cmd+A,選取所有標記並複製。抽取器需要的就是這份完整原始碼。
- 開啟連結抽取器,將複製的 HTML 貼到輸入欄位中。
- 如果工作表使用像 /pricing 或 ../guide 這樣的相對路徑,而您希望將其解析為絕對網址,請在選填的基準網址欄位中輸入原始發佈工作表的頁面網址。若沒有提供基準,相對值就會保持為相對形式,且不會憑空捏造主機。
- 點選Extract,並查看結果面板中顯示的三個計數:唯一、重複與略過。唯一計數就是最終清單的數量。
- 複製每行一筆的結果,貼到新的 Google Sheets 欄、CSV 檔或任何其他目的地,以便進行後續處理。
抽取器保留什麼、略過什麼
解析器套用一組有限的規則,所以輸出是可預期的。下方表格摘要列出主要情況。貼上原始碼之前,可先參考它來預期唯一計數的樣貌。
| 來源中的網址形式 | 動作 | 備註 |
|---|---|---|
| 絕對的 https://... 或 http://... | 保留並正規化 | 每一個不同的目標各佔一筆。 |
| mailto: 或 tel: | 保留 | 屬於合法的目標,雖然並非網頁。 |
| 根目錄相對或路徑相對,例如 /pricing 或 ../guide | 若有有效的 HTTP(S) 基準網址則進行解析,否則照原樣保留 | 若未提供基準,則不會憑空捏造主機。 |
| 協定相對,例如 //cdn.example.com/x.css | 若有有效的 HTTP(S) 基準網址則進行解析 | 規則與根目錄相對相同。 |
| 同頁片段,例如 #section,以及空值 | 略過 | 並非可導覽的目標。 |
| javascript:、data:、vbscript: | 略過 | 可執行程式或嵌入資料的協定絕不會回傳。 |
| 無效的絕對網址 | 略過 | 會計入略過總數,讓篩選動作能被看見。 |
| 正規化後的重複項目 | 合併 | 結果中保留首次出現的順序。 |
當結果清單看起來比預期短時,略過計數就很關鍵。短結果不一定代表連結很少;它可能代表有幾個目標因安全性而被過濾掉、是空的,或不是有效的網址。把唯一、重複與略過這三個計數一起讀,就是確認解析器有看到完整來源、並做出您預期之篩選決策的方法。
事先要確認的限制與邊界情況
抽取器讀取的是貼上的原始碼,所以任何只有在瀏覽器執行頁面腳本後才存在的東西都不會出現。靜態的 Google Sheets HTML 匯出通常不會透過 JavaScript 注入超連結,但如果工作表是透過 Apps Script 網頁應用程式發佈、被嵌入到另一個頁面,或被自訂的 HTML 範本包起來,那麼在執行階段才加入的動態連結可能會缺少。對於標準的工作表下載,HTML 檔代表的就是匯出當下工作表所包含的內容。
另外還有 200,000 字元的輸入上限。單張工作表的匯出若有數百欄與大量連結,可能會逼近該上限,特別是當 HTML 帶有大量行內樣式與大型嵌入資料 URI 時更是如此。當輸入接近上限時,請將原始碼拆成兩次處理——一次處理檔案的上半部,一次處理下半部——或在貼上之前先修剪不必要的標記,例如內嵌的 CSS 區塊。非常大的文件應交由可控的爬蟲處理,而非單次貼上。
基準網址欄位僅接受 HTTP 或 HTTPS 值,且不得包含認證資訊。這是刻意的設計:含有 user:pass@host 的基準會在使用者資訊外洩到每個解析後的連結,而非 HTTP 協定則會產生誤導性的解析情境。若您的工作表發佈於 https://docs.google.com/spreadsheets/... 這樣的網址,請將該完整網址貼入作為基準。檢查刻意設計得很嚴格,以確保解析情境永遠反映使用者實際輸入的內容。
輸出是一份清單,而非健檢報告。列出的網址可能會重新導向、回傳錯誤、需要驗證、被 robots 機制阻擋,或刻意指向站外。抽取器不會標示內部與外部連結、不會測試 HTTP 狀態、不會評估 rel 屬性,也不會給予 SEO 品質評分。當這些資訊很重要時,請以另一個具授權的工具來檢視並爬取這些網址。
信賴這份清單之前,請先驗證結果
當每行一筆的清單被貼到新的工作表後,請手動抽查前幾筆,確認匯出與來源一致。請特別留意可見標籤與目標網址不同的儲存格——Google Sheets 同時保留了兩者,手動計算相異網址數量是最簡單的健全性檢查。如果來源工作表中某欄重複出現同一個網址很多次,請預期重複計數會偏高。
若要做更深入的稽核,請將匯出的 HTML 與同一張已發佈工作表的瀏覽器 DOM 匯出做比對。在瀏覽器中開啟線上工作表,查看其原始碼或儲存渲染後的頁面,然後比對兩個檔案。任何只出現在瀏覽器原始碼、而未出現在下載 HTML 中的項目,很可能是由腳本或渲染引擎所插入,已超出以原始碼為基礎的掃描範圍。認識到這段差距,正是使用不會執行 JavaScript 的解析器時的一部分課題。
最後,當清單需要進行狀態、重新導向或 rel 檢視時,請將清理後的網址交給具授權的爬蟲或 HTTP 標頭工具。連結抽取器刻意只到清單階段就結束——把抽取與網路請求綁在一起會讓兩種失敗模式耦合,使結果更難以重現。將它視為快照產生器,能讓工作流程清晰、輸出可稽核。
若想更深入了解,請參閱如何在 ads.txt 中授權 Google AdWords 賣家。
若想更深入了解,請參閱從 HTML 將 LinkedIn 聯絡人網址匯入 Excel。