若要擷取 LinkedIn 個人檔案連結,請將包含該連結的 HTML 原始碼貼到瀏覽器型解析工具,例如 Link Extractor。您可以選擇性地加入來源頁面的 URL 作為基底,將相對路徑轉換為絕對路徑,然後從逐行輸出中直接複製產生的 linkedin.com/in/... 條目。該工具會從 anchor、area 與 link 起始標籤讀取 href 屬性,在每個值內解碼一組有限的字元參照,正規化 mailto、tel 與絕對網路目標,移除僅含片段與 javascript: 的條目,並去除重複的結果,同時回報被略過值的數量,讓空白或不安全的目標不會悄悄膨脹計數。整個過程完全在頁面內執行:原始碼在本機解析,不會向任何目的地發送請求,這表示無論是單一作者簡介、靜態電子報、私密的合作夥伴目錄,或任何您有權檢視的來源,都能在不實際載入連結檔案的情況下進行分析。掃描完成後,清理過的 URL 可直接放入 CRM 記錄、引文查核、開發信清單或招募流程中,而不會在 LinkedIn 端觸發任何自動擷取。
這項任務分為兩部分:找出指向 LinkedIn 的 href,以及將其呈現為一個乾淨且去重複的絕對 URL。兩者都由解析器在單一貼上並擷取的循環中完成,本文剩下的部分會逐步說明使用過程中會遇到的實務決策。

「擷取 LinkedIn 個人檔案連結」實際上代表什麼
LinkedIn 個人檔案連結指的是任何指向 linkedin.com 的 href——最常見的是 https://www.linkedin.com/in/yourname,有時是單純的 /in/yourname 格式、加上 https 後綴的 sales navigator 變體,或是位於 /company/.... 的公司頁面。擷取代表將該目標字串從較大的 HTML 內容中分離出來,並以不含任何標記、已去重複的絕對 URL 形式回傳。
實際上,來源會以三種形式出現:單行 CMS 原始碼中,一個連結置於其脈絡中;靜態 HTML 電子郵件中,收件人的個人檔案以 anchor 連同其姓名包在一起;或是大型文件,例如客座文章署名、新聞稿、研討會講者名單或合作夥伴頁面,而您只關心其中一個條目。在這三種情況下,相同的解析器皆可運作,因為任務始終相同——找出 href,並以可用形式回傳 URL。
關鍵在於什麼構成「可用」的形式。Link Extractor 會依首次出現的順序,逐行回傳經過正規化與去重複處理的 URL,因此「可用」代表您可以選取單一行,直接貼入 CRM 欄位、開發信範本或試算表,無需重新排版。結果面板底部的「略過計數」顯示,正是讓您能信任簡短清單的原因:它會說明有多少僅含片段、空白或 javascript: 的條目被悄悄過濾掉,因此即使結果僅有一兩行,仍具備稽核可信度。
Link Extractor 如何找出個人檔案 URL
掃描完全在您的瀏覽器中執行,對象是您貼上的來源,而非目的地。它會走訪 anchor、area 與 link 元素的起始標籤中的 href,解碼有限的字元參照集(十進位、十六進位,以及具名集 amp、quot、apos、lt 與 gt),然後對結果進行正規化。絕對的 http、https、mailto 與 tel 目標會直接通過;相對值會對照您選擇性提供的基底 URL 進行解析;根相對路徑會轉為絕對路徑;協議相對的 //linkedin.com/in/jane-doe 會變成 https://linkedin.com/in/jane-doe。正規化完成後,工具會去除重複條目,同時保留首次出現的順序,並逐行寫入一個 URL。
三項包含規則直接影響個人檔案連結。空白值與 #section 等同文件片段會被略過,這讓錨點同時作為捲動觸發器的頁面,其列數保持誠實。可執行的協議 (javascript:、data: 與 vbscript:) 永遠不會回傳,當來源 CMS 使用 onclick 處理器或看似錨點的 base64 酬載時,這能保護輸出結果。無效的絕對 URL 也會被略過,並回報計數,讓簡短的清單不會隱藏過濾決策。郵件與電話目標則會保留,因為它們雖非網頁,但仍是合法的連結目的地。
| 掃描的元素 | href 在來源中的位置 | LinkedIn 個人檔案使用情境 |
|---|---|---|
| <a> 錨點 | 在使用者介面中,與姓名、大頭貼、署名或按鈕相鄰的可點擊連結 | 最常見的情況:<a href="https://www.linkedin.com/in/jane-doe">Jane Doe</a> |
| <area> | 位於影像地圖內,雖不常見但解析器支援 | 用於團隊頁面中,數張大頭貼位於同一影像地圖的情況 |
| <link> | 位於 head 層級的資源參照,非使用者介面元素 | 個人檔案連結中較少見,但 LinkedIn 自有頁面上的 <link rel="canonical"> 或樣式表會被捕獲 |
有一點值得注意:此解析器是來源掃描器,而非瀏覽器 DOM 建構器。註解與常見的原始文字容器 (script、style、textarea、title、iframe、noembed、noframes) 會在連結掃描前先移除,因此 JavaScript 或字面文字中僅僅看起來像錨點標記的字串,不會成為偽連結。嚴重格式錯誤的標記可能產生與真實瀏覽器不同的 DOM;在安全性、法律或遷移稽核中,擷取出的清單應與來自無頭擷取的 DOM 匯出進行交叉比對,而不是單獨信任。
從貼上的來源中取出個人檔案 URL
- 複製您有權檢視的來源。透過瀏覽器的檢視原始碼、CMS 中的「編輯 HTML」,或電子郵件用戶端的「複製為 HTML」,皆可產生可用字串。程式碼片段至少需包含包圍個人檔案 URL 之錨點的起始標籤;其周圍的標記可以更多。
- 開啟 Link Extractor 並貼上。將來源放入輸入區。若每個連結皆已是絕對路徑(多數 CMS 渲染的頁面與大多數電子郵件已是如此),則將基底 URL 欄位留空。若來源使用如 /in/jane-doe 等相對路徑,請填入來源頁面的絕對 URL,以便正確解析路徑——例如,輸入檢視頁面時瀏覽器顯示的網址。
- 執行擷取。工具會掃描 href 屬性、解析需要解析的內容、正規化目標,並在結果面板中逐行回傳 URL。面板亦會回報唯一、重複與略過的數量,讓您確認沒有重要的內容被過濾掉。
- 複製符合的那一行。在典型的署名中,您將只會看到一個 linkedin.com/in/... 條目。選取該列,並將其貼入您的 CRM 欄位、通訊錄、開發信記錄或文件中。逐行格式代表將大量內容貼入試算表時,每個個人檔案會各自佔據一列,保持整齊。
何時應加入基底 URL——以及何時應略過
相對路徑在兩種情況下常見。CMS 範本通常會寫成 /in/jane-doe 而不含主機名,期待網站一併渲染;電子郵件行銷平台則經常使用協議相對 URL,以維持連結在 HTTP 與 HTTPS 環境下皆有效。在這兩種情況下,提供來源頁面的 URL 作為基底,可讓解析器將這些路徑轉為完整的 linkedin.com 網址。
若來源已包含絕對 URL,則無需提供基底——對一份已包含 https://www.linkedin.com/in/jane-doe 的文件加入基底,並不會改變結果,因為絕對值會原封不動地通過正規化處理。基底 URL 僅影響相對值。
有一點值得特別提醒。解析器採用瀏覽器的 URL 模型,這代表相對 href 會對照您所提供的精確頁面 URL 進行解析。若來源寫著 /in/jane-doe,而您貼上 https://example.com/team/ 作為基底,結果將會是 https://example.com/in/jane-doe,而不是 linkedin.com 的網址。僅在相對目標確實是以 LinkedIn 來源撰寫時,才以 LinkedIn 頁面作為基底;否則請將基底留空,並手動清理少數絕對條目。
擷取後該如何處理個人檔案連結
單一擷取的 URL 有許多後續用途。將其貼入應徵者追蹤備註、附加於研討會 RSVP、附加至記者開發信記錄,或作為「LinkedIn」欄位加入 CRM 聯絡人。若您正在管理招募流程或合作夥伴記錄,逐行格式可直接放入試算表的第一欄,無需進一步編輯。
有一項關注點分離值得留意:Link Extractor 是一項盤點工具。它告訴您來源中存在哪些連結目標,但不會造訪這些目標、測試其 HTTP 狀態、評估 rel 屬性、判斷連結為內部或外部,或將其標記為 canonical、導覽或樣式表。若需進行上述任何判斷,請對複製的 URL 執行真正的爬蟲或狀態檢查工具。
對於已將 URL 以不同格式保存,並希望直接匯入 Excel 而非 CRM 的讀者,從 HTML 將 LinkedIn 聯絡人 URL 擷取至 Excel 一文涵蓋了從結果清單到活頁簿、不需重新輸入的步驟。
需要留意的限制
三項限制決定了基於來源的擷取在何種情境下是合適的方法。
動態連結——JavaScript 在頁面載入後才插入的連結——不會出現在靜態來源中。若個人檔案 URL 僅在指令碼執行後才出現,例如位於 React 元件或延遲載入的小工具中,則貼上檢視原始碼將無法擷取到它。在此情況下,請使用瀏覽器 DevTools 對渲染後的節點執行「複製 outerHTML」,或從無頭擷取匯出渲染後的 DOM,再將其輸入解析器。
格式錯誤的標記可能干擾有限的解析器。未加引號的屬性、缺少的原始文字結束標籤,以及不尋常的復原情境,皆可能產生與真實瀏覽器不同的 DOM。若該頁面是法律、安全或遷移稽核的紀錄來源,請將擷取結果與瀏覽器 DOM 匯出進行交叉比對,而不是僅憑單一管道。
輸入大小每次執行上限為 200,000 字元。長篇文件——整個已擷取的頁面、完整的電子郵件彙總、大型 CMS 匯出——應在貼上前先分割,或過濾至包含個人檔案連結的段落,以維持輸入遠低於上限,並讓結果清單短到足以目視檢查。
若您正在權衡選項,從 Sitemap 擷取連結以進行稽核與遷移 一文有詳細說明。