LinkedIn 個人檔案頁面包含數十個嵌入的 URL —— 專案、出版物、證照、現在與過去的雇主、學校、個人網站和聯絡郵件的連結 —— 而從 HTML 原始碼中擷取這些目標,是組裝一份超越標準 LinkedIn PDF 匯出的自訂履歷最快的方式之一。Link Extractor 會在您的瀏覽器中本機解析貼上的 HTML,掃描起始標籤中 anchor、area 和 link 元素的 href 值,去除重複結果,並以每行一個 URL 的方式回傳,同時顯示透明的不重複、重複和略過項目計數。由於該工具僅解析原始碼且從不請求任何目的地,因此將其用於您有權檢視的 LinkedIn 頁面 HTML 是安全的 —— 無論是您自己的個人檔案、您在所操作的招募系統中的候選人檔案,或儲存在磁碟上的快照 —— 都不會聯絡 LinkedIn 或任何列出的目標。選用的基礎 URL 可讓相對路徑在個人檔案以非根路徑擷取時解析為絕對地址。最終結果是該個人檔案所指向的每個 URL 的整潔清單,您可以檢視、篩選並匯入履歷範本、聯絡表或招募稽核中。

how to extract linkedin profile as cv
how to extract linkedin profile as cv

LinkedIn 履歷的兩種路徑:內建匯出與原始碼擷取

LinkedIn 在每個個人檔案上提供一鍵「另存為 PDF」的路徑,對大多數求職者來說,這是下載履歷最簡單的方式。該 PDF 是在伺服器端產生,並反映 LinkedIn 渲染時的頭像、標題、摘要、工作經歷和教育背景區段。當招聘流程接受標準 LinkedIn 風格的履歷,且您不需要對嵌入連結進行精細控制時,這種方式效果良好。

另一種工作流程從個人檔案的 HTML 原始碼開始。如果您已在 LinkedIn 之外維護履歷範本、執行擷取結構化連結資料的招募流程,或想要組裝一份可點擊參考的作品集 —— 專案頁面、GitHub 儲存庫、會議演講、證照驗證 URL —— 則匯出功能就不敷使用。PDF 讀取器會視匯出設定將連結扁平化為純文字或予以移除。從 HTML 原始碼著手可將 URL 保留為可點擊的目標,予以去除重複,並產生一份可直接匯入任何下游工具而無需重新輸入每個地址的清單。

隱藏在 LinkedIn 個人檔案 HTML 原始碼中的 URL

典型的個人檔案帶有可歸入少數群組的錨點。精選區段會連結到文章、貼文和外部作品集頁面。工作經歷區段包含公司個人檔案連結、專案連結,有時還有出版物參考。教育背景區段會連結到學校、課程提供者,有時還有學位驗證頁面。證照區段會指向核發機構,並在可取得時提供證書驗證 URL。聯絡資訊面板會新增個人網站、作品集 URL 和 mailto 或電話目標。動態與興趣區段則會新增群組、活動和對話的 URL。

普通錨點將使用者指向文件,area 元素為影像地圖新增目標,而 link 元素則可參考樣式表、圖示、正規頁面或其他替代資源。Link Extractor 包含這三種元素類型,因為其工作是原始碼盤點 —— 無論目標是導航性、正規性、預載入、樣式表或其他關係,它都會回傳頁面所包含的任何 href 值。當您想要取得個人檔案所指向的每個連結時,這種廣度很有用,並消除了事先猜測哪些標籤重要的麻煩。如需更深入地逐步說明如何從 LinkedIn 頁面提取 URL,請參閱從 HTML 原始碼擷取 LinkedIn 個人檔案 URL指南。

面向 LinkedIn 內建 PDF 匯出 使用 Link Extractor 進行 HTML 原始碼擷取
標題、摘要、工作經歷、教育背景 自動包含 非擷取範圍 —— 由您自行建構文件
嵌入的 URL(專案、證照、網站) 部分以純文字顯示,通常無法點擊 以去除重複的可點擊清單形式回傳
格式控制 僅限於 LinkedIn 的範本 由您控制履歷範本
伺服器端活動 PDF 在 LinkedIn 的伺服器上產生 解析在瀏覽器中本機進行
輸出格式 PDF 文件 每行一個 URL 的純文字
mailto 和 tel 目標的處理 視為純文字 正規化後保留並去除重複

從 LinkedIn 個人檔案的 HTML 中擷取連結

此工作流程將 LinkedIn 個人檔案視為連結資料的靜態來源,並對該頁面的 HTML 執行 Link Extractor。解析作業在本機完成;擷取過程中從不聯絡 LinkedIn。

  1. 開啟您有權檢視的個人檔案。在桌面瀏覽器中載入您自己的個人檔案、您管理的招募系統中的候選人檔案,或儲存的快照。在頁面上按右鍵並在 Chrome 或 Edge 中選擇「檢視頁面原始碼」,或在 Firefox 中選擇對等指令。開啟的 HTML 將是解析器要處理的靜態來源。
  2. 複製並貼上整個 HTML 文件。在原始碼檢視中選取全部、複製,然後貼到 Link Extractor 輸入區域。該工具接受最多 200,000 個字元;非常長的封存檔應予以分割。
  3. 將個人檔案的絕對 URL 新增為基礎。LinkedIn 個人檔案位於 https://www.linkedin.com/in/username 這類路徑 —— 請貼上該確切值,以便頁面內任何根相對、路徑相對或協定相對的 href 解析為絕對地址。基礎 URL 必須使用 HTTP 或 HTTPS,且不能包含認證資訊。
  4. 執行擷取工具。該工具會移除註解和 script、style、textarea、title、iframe、noembed 和 noframes 等原始文字容器,然後在清理後的原始碼中掃描 a、area 和 link 起始標籤上的 href 屬性。
  5. 檢視三個計數器。不重複顯示正規化後存留的不同目標數量,重複顯示已合併的重複項目數,略過則報告因空白、僅片段、可執行(javascript、data、vbscript)或無效而被篩除的值數量。
  6. 複製每行一個的輸出。將結果貼到您的履歷範本、試算表或稽核表中。從這裡開始,請在發布前使用經授權的工具驗證每個目標 —— 擷取工具不會區分內部與外部連結、不會測試 HTTP 狀態、不會評估 rel 屬性,也不會判斷 SEO 品質。

Link Extractor 會篩除的項目

該工具刻意略過多個類別的值,以保持輸出整潔且易於處理。

空白的 href 值會被捨棄。#section 或 #experience 等同文件片段會被捨棄,因為它們指向同一頁面而非外部目標。可執行或嵌入資料的協定 —— javascript:、data: 和 vbscript: —— 永遠不會被回傳,即使個人檔案的靜態原始碼中恰好包含它們。無效的絕對 URL 也會被略過。結果會報告有多少不安全或無效的值被省略,因此表面上看似簡短的清單並不會隱藏篩選決策。

郵件和電話目標會被保留,因為它們即使不是網頁,也是合法的連結目的地。如果個人檔案在聯絡資訊中列出個人網站,您將在結果清單中同時看到 http URL 和 mailto: 地址。重複項目會在正規化後移除,並保留首次出現的順序 —— 兩個解析為同一絕對 URL 的相同相對連結會合併為一個項目。

解讀不重複、重複和略過計數

每次執行都會在結果清單旁產生三個計數器。不重複是正規化後去除重複的目標數。重複是合併至較早項目的項目數量,在 LinkedIn 個人檔案上通常不為零,因為同一個網站 URL 可能同時出現在聯絡面板和關於區段中。略過則是解析器拒絕回傳的 href 值的數量。

即使是乾淨的個人檔案,略過計數非零也是預期的情況。一些 # 或 #main-content 等內部錨點會因片段而被篩除,少量 javascript: 目標可能來自已由原始文字移除步驟清理過的內嵌指令碼,而這些仍可能出現在靜態原始碼中。請將三個數字一併解讀:健康的個人檔案頁面通常顯示較高的不重複計數、較小的重複計數,以及略過計數大致等於版面配置中片段和空白錨點的數量。

原始碼解析的限制與誠實的權衡

原始碼解析具有工具不會隱藏的明確界線。

  • 輸入上限。為保持互動式掃描在可控範圍內,該工具在超過 200,000 個字元時停止接受輸入。LinkedIn 單一個人檔案頁面通常遠低於此上限,但包含數十個個人檔案的封存檔需要分割或以受控的爬蟲處理。
  • 不進行即時擷取。該工具無法擷取遠端 URL,因為任意的跨來源請求經常會被封鎖,且靜默地聯絡貼上的連結會產生隱私和安全問題。請從您有權檢視的頁面複製頁面原始碼,或透過您自己的爬蟲取得 HTML。
  • 動態連結。在指令碼執行後插入的連結不會存在於靜態原始碼中,因此在此處不會被找到。LinkedIn 在初始文件載入後會水合(hydrate)大部分頁面;在擷取原始碼後由 JavaScript 渲染的錨點將會遺失。
  • 基礎 URL 規則。基礎 URL 必須使用 HTTP 或 HTTPS,且不能包含認證資訊。這些檢查可防止產生誤導性的解析內容,並避免使用者資訊被複製到每個解析結果中。
  • 格式錯誤的標記。嚴重格式錯誤的標記、不常見的未加引號屬性、缺少的原始文字結束標籤或瀏覽器的錯誤復原機制,都可能產生與有界掃描不同的 DOM。若要進行法律、安全或遷移稽核,請比較原始來源、瀏覽器 DOM 匯出和實際爬蟲的結果,而非僅信任單一擷取管道。
  • 盤點而非健檢報告。輸出是目標清單,而非稽核報告。列出的目標可能重新導向、回傳錯誤、需要驗證、被 robots 控制封鎖,或刻意指向站外。若這些事實對履歷有影響,請使用經授權的工具檢視並爬取這些 URL。

相關閱讀:從 HTML 擷取單一 LinkedIn 個人檔案連結