連結萃取器將任何已儲存的 LinkedIn 頁面 HTML 轉換成去重複的個人檔案與聯絡 URL 清單,讓您可以直接貼到 Excel 中;當您提供頁面的基底 URL 時,相對路徑的 href 也會被解析。由於整個工作流程都在您的瀏覽器分頁中本地執行:貼上 HTML、選擇性貼上頁面 URL、執行萃取、複製每行一個 URL 的結果,然後將其放入單一 Excel 欄位。這個工具絕不會登入 LinkedIn、呼叫其 API,或請求它所發現的任何 URL,因此解析器本身不會對 LinkedIn 的伺服器增加任何請求,而唯一的網路活動是您之後在自己瀏覽器中進行的操作。兩個實際的限制會影響結果:每次貼上的輸入上限為 200,000 字元,以及解析器讀取的是靜態原始碼而非渲染後的 DOM,因此在頁面載入後由 JavaScript 插入的連結不會出現在您的 HTML 中。在用於您有權檢視的 HTML 時,這個工具能產生聯絡流程的前半段 — 一份乾淨的 URL 清單 — 將豐富化與驗證留作獨立且謹慎的步驟。

how to extract linkedin contacts to excel
how to extract linkedin contacts to excel

連結萃取器能為已儲存的 LinkedIn HTML 做什麼

連結萃取器會讀取您貼上的 HTML 文件,在 anchor、area 與 link 起始標籤上找到每個 href 屬性,並回傳每行一個去重複的 URL,讓您可以貼到 Excel 中。它不會登入 LinkedIn、呼叫其 API,或請求它所發現的任何 URL。當您提供 LinkedIn 頁面 URL 作為基底時,像 /in/jane-doe 這樣的相對路徑會被解析成絕對位址,例如 https://www.linkedin.com/in/jane-doe。若沒有提供基底,相對值則會保持相對,讓輸出結果不會虛構出一個主機。

誠實的範圍在這裡很重要:這個工作流程萃取的是連結目標,而非聯絡記錄。您最終會得到一份乾淨的個人檔案、搜尋、mailto 與電話 URL 清單,而不是一份包含姓名、職稱與電子郵件地址的試算表。若您需要這些欄位,則需要將這份 URL 清單與一個經授權的豐富化步驟搭配使用,例如親自開啟每個個人檔案,或使用 LinkedIn 官方的資料匯出。連結萃取器的工作是流程的前段:產生一份可靠的位址清單,讓您可以貼入一個欄位中。

因為所有事情都在瀏覽器分頁中進行,您的 HTML 與產生的清單永遠不會離開您的電腦。沒有上傳步驟、不需要帳號,也不會向解析器發現的任何 URL 發送請求。

來源與權限考量

僅貼上您有權檢視的 HTML。這包括您已從自己瀏覽器工作階段中儲存的頁面、自己的 LinkedIn 資料匯出、您有權稽核的公開個人檔案頁面,或由您在授權範圍內執行的自製爬蟲所產生的 HTML。請勿貼上透過違反 LinkedIn 使用者協議、在未獲授權的情況下於登入牆後進行爬取,或繞過技術存取控制所蒐集而來的 HTML。這個工具會很樂意解析您給予的任何來源,因此對於您貼上內容的責任仍歸屬於您。

兩個實務上的問題經常讓人卡關。首先,輸入上限為 200,000 字元,這對大多數已儲存的 LinkedIn 頁面已足夠,但對於大型的已儲存工作階段則不夠。若您的 HTML 較大,請將其分割,或使用遵守上限的受控爬蟲。其次,LinkedIn 在 JavaScript 執行後才插入的動態連結,不會出現在靜態原始碼中。在腳本執行後儲存頁面(或匯出渲染後的 DOM)是擷取這些連結的唯一方法;這是一個讀取原始碼的解析器,而非無頭瀏覽器。

將 LinkedIn 個人檔案 URL 萃取到 Excel:逐步說明

  1. 開啟您有權檢視的 LinkedIn 頁面並儲存其原始碼:在大多數桌面瀏覽器中,可以使用 Ctrl+U(在 macOS 上為 Cmd+Option+U),然後使用 Ctrl+ACtrl+C 來複製整份 HTML 文件。
  2. 在新分頁中開啟 連結萃取器 工具,並將 HTML 貼到來源欄位中。
  3. 複製頁面網址列中的 URL,並將其貼到基底 URL 欄位。對於使用根相對路徑的動態消息、搜尋結果或目錄頁面,請使用完整的 https://www.linkedin.com/... 位址。
  4. 執行萃取。結果區域會顯示唯一目標的數量、被合併的重複項,以及因空白、片段、可執行協定或無效 URL 而被略過的值。
  5. 檢視每行一個 URL 的輸出。確認預期的 https://www.linkedin.com/in/... 個人檔案確實存在,並確認 javascript:、data: 與 vbscript: 目標已被過濾掉。
  6. 點擊複製按鈕,並將清單貼到單一 Excel 欄位中,從 A1 開始。從那裡您可以進行排序、篩選,或在稍後需要分割合併字串時使用「文字剖析」。

解析器會擷取的連結類型(以及它會略過的項目)

LinkedIn 頁面包含幾種帶有連結的標籤。這個工具會掃描全部三種,因為它的工作是來源清單而非導覽分析。下表摘要說明每種標籤在 LinkedIn HTML 上通常承載的內容,以及解析器如何處理它。

起始標籤典型的 LinkedIn 用途解析器行為
<a href>個人檔案連結、搜尋結果列、mailto 與 tel 聯絡方式、動作按鈕保留(含 mailto 與 tel),在正規化後進行去重複
<area href>影像地圖區域(在 LinkedIn 上少見,但會出現在舊版頁面中)保留並與其他項目一起進行去重複
<link href><head> 中的 canonical、alternate、preload、stylesheet、icon 參照作為清單的一部分保留;此工具不會標示 rel 的意義

解析器會在掃描前移除註解與原始文字容器,例如 script、style、textarea、title、iframe、noembed 與 noframes,這能避免 JavaScript 或模板字串中看起來像錨點標記的字串被誤認為真實的連結。它也會略過空白值、同文件片段(例如 #comments),以及使用可執行或內嵌資料協定的目標,例如 javascript:、data: 與 vbscript:。被略過的數量會顯示在結果中,因此看似簡短的清單並不會隱藏過濾決策。

目標形狀範例結果
絕對網頁 URLhttps://www.linkedin.com/in/jane-doe原樣保留
含基底的根相對路徑/in/jane-doe + 基底 https://www.linkedin.com/feed/解析為 https://www.linkedin.com/in/jane-doe
含基底的路徑相對../in/jane-doe + 基底 https://www.linkedin.com/feed/news/解析為 https://www.linkedin.com/feed/in/jane-doe
mailto 或 telmailto:[email protected]保留(合法的連結目的地)
同文件片段#comments略過
可執行或資料協定javascript:void(0), data:text/html,...略過
空白的 hrefhref=""略過
無效的絕對 URLhttps://example .com/bad略過

將清單貼入 Excel

當每行一個 URL 的輸出已複製到剪貼簿後,請開啟新的或現有的活頁簿,並在貼上之前點選一個儲存格(通常是 A1)。Excel 會將每一行放入 A 欄的個別列中,這是最容易篩選與排序的格式。若您希望先將網域與路徑分開,Excel 的資料 → 文字剖析精靈可以依 / 或協定冒號進行分割,雖然對大多數外聯工作流程來說,將完整 URL 放在單一欄位中即可。

一個常見的改良做法是在 URL 清單旁加入輔助欄位:一個由您手動填入或使用授權 HTTP 檢查工具填入的狀態欄、一個用於個人標籤的備註欄,以及一個用於追蹤後續聯絡的外聯狀態欄。連結萃取器的輸出是清單;而活頁簿則是您將這份清單轉化為可運作的聯絡流程的地方。若您也需要從已儲存的 Excel Hyperlink 中擷取連結目標,同一種解析器方法也適用於儲存在 .xlsx 檔案中的 HTML,如這篇透過 HTML 原始碼從 Excel 超連結擷取連結的指南所述。

萃取之後:驗證每個 URL

匯出的清單是清單,並非健全性報告。清單上的 LinkedIn URL 可能會重新導向到登入牆、傳回錯誤、需要驗證、被 LinkedIn 的自動化控制封鎖,或是刻意指向平台外部。解析器並不會標示內部或外部連結、不會測試 HTTP 狀態碼、不會評估 rel 屬性,也不會判斷 SEO 品質,因此對於這些事實,您需要另行進行經授權的檢查。

實務上最重要的兩個檢查是:首先,將每個 URL 透過 HTTP 狀態工具執行,以確認它仍然可以解析,並找出重新導向或 soft-404 模式。其次,手動開啟一部分個人檔案樣本,以了解哪些目標仍然存在,哪些已被刪除、設為私人或重新命名。只有在通過這些檢查之後,URL 清單才算準備好進入流程的下一個階段,無論那是手動外聯、CRM 匯入,或是研究專案。

若您正在權衡選項,Excel COMBIN 與 COMBINA:計數與真實組合的比較對此有詳細說明。