SEO 關鍵字研究 | 從 9,645 則客戶對話挖出真實搜尋字
AI 文章延伸
選擇平台後可直接帶入閱讀脈絡,快速整理重點、補齊盲點,並延伸到同站相關文章。
SEO 關鍵字研究最準的種子字,不在工具的推薦清單裡,而在你的客服對話紀錄裡。我們把一年份的客戶訊息倒出來重跑一遍,發現一件事:客戶說「外掛打架」,我們卻在文章裡寫「相容性問題」,客戶說「轉圈圈」,我們寫「載入緩慢」。兩邊講的是同一件事,但搜尋框裡輸入的字完全對不上。
這篇是我們自己踩出來的方法論。先講為什麼工具給的種子字會失準,再講我們怎麼從 9,645 則對話裡把客戶真正用的字挖出來。
為什麼關鍵字工具給的種子字會失準
我們讀過目前搜「SEO 關鍵字研究」排在前面的幾篇文章,切入點高度一致:教你打開 Ubersuggest、SEMrush、Ahrefs 或 Google Keyword Planner,輸入一個字,看它吐出搜尋量和難度。工具很好用,這步也該做,問題是它們全都跳過了一個更前面的問題:你一開始輸進去的那個種子字,是從哪來的?
其中一篇說得很誠實,「讀者真正輸入的,是哪些字,而不是你以為他們會輸入的」。這句話點到了痛處,但它給的解法還是回頭打開工具。工具能告訴你一個字有多少搜尋量,沒辦法告訴你該查哪個字。種子字如果本身就是我們坐在辦公室裡想出來的,那再精準的搜尋量數據,也只是把猜測包裝得比較有數字感。
落差就出在語言。我們是做網站的,習慣講「相容性」「效能」「遷移」,客戶不是。他們打開對話框,打的是「兩個外掛裝了會衝到」「網站變超慢一直轉圈圈」「我想把網站搬去別的主機」。這些才是他們真的會丟進 Google 的字。內容選題如果建立在專業術語上,寫得再深,也是在對一批不存在的搜尋量說話。
資料從哪來:一年的客服對話紀錄
我們手上剛好有一座沒被動過的礦:OrderChatz 累積的客服對話。這是我們自己開發的 WooCommerce 客服系統,一年下來存了大量客戶跟我們、以及客戶彼此之間的真實訊息。這些對話的價值,在於它不是問卷、不是訪談,是客戶在真的遇到問題、真的想解決的當下打出來的字,沒有經過任何「你覺得這個功能如何」的引導。
這一點跟我們談需求訪談時反覆強調的原則是同一件事:別問客戶對未來的意見,看客戶過去實際發生的行為。訪談容易拿到禮貌性的贊同,客服紀錄拿到的是客戶卡住時的原始反應。用在關鍵字上,道理一樣,工具給的是我們假設客戶會搜的字,客服紀錄給的是客戶已經打出來的字。
從 22,600 則訊息清洗到 9,645 筆
原始資料很髒。一年的紀錄倒出來有 22,600 則訊息,裡面混著系統通知、貼圖、一句「好的」、重複轉貼的網址。直接丟給 AI 分析,只會得到一堆「可以」「這個」「請問」這種沒有分析價值的高頻詞。
我們先做了兩層過濾。第一層抓出純粹的客戶文字留言,把系統訊息和機器人的回覆剔掉,剩下 12,000 則。第二層訂了四條清洗規則:
- 剔除過短訊息(像「好」「收到」這種)
- 剔除純網址的訊息
- 剔除只有表情符號的訊息
- 剔除重複內容
跑完剩下 9,645 筆,這才是有分析價值的資料。
這裡踩到第一個坑:中文斷詞失效。我們一開始想用傳統的斷詞工具先把句子切成詞,再統計詞頻。結果中文口語缺乏結構,「網站一直轉圈圈是不是掛掉了」這種句子切完,浮上來的全是「是不是」「一直」這類功能詞,真正有意義的「轉圈圈」「掛掉」反而被稀釋掉。標準斷詞是為書面語設計的,遇到客服對話這種口語就失準。
派 14 個 AI 代理平行讀對話
換掉斷詞,我們改用 AI 代理做語義理解。9,645 筆一次丟給單一模型太重,我們把資料切成 14 個批次,同時派 14 個 AI 代理平行處理,每個代理只負責讀自己那批,抽出三類資訊:
- 客戶提問句:抽出 566 條,例如「LINE 推播沒收到怎麼辦」
- 客戶詞彙:抽出 590 個,客戶實際用的名詞和動詞
- 卡關描述:抽出 373 條,客戶描述問題時的原始說法
平行處理的好處不只是快。14 個代理各自獨立,一個批次抽壞了不會污染其他批次,最後合併時也比較容易對照出哪些詞是跨批次反覆出現的高頻字。
這步的關鍵風險是 AI 會自作聰明:模型讀到「藍新」會想幫你改成「NewebPay」,讀到「轉圈圈」會想改成「載入延遲」,一改就把我們要找的東西改掉了,所以我們在指令裡明確規定:保留客戶原始用詞,客戶說藍新就是藍新,不准翻譯成專業術語。
AI 自動分類本來就有分類錯誤的品質風險,我們的作法是先鎖死「不改字」這條規則,把判斷空間壓到最小,再靠人工抽查合併後的結果。
我們也保留了一個維度:區分一對一私訊和群組對話,私訊多半是產品諮詢,客戶帶著明確目的來問,字比較貼近交易;群組對話是開放討論,字比較發散、偏資訊型,這個區分讓後面排選題時能對得上搜尋意圖。
產出:客戶用語對照表與選題清單
跑完最有價值的產出,是一張客戶用語對照專業術語的表:
| 客戶怎麼說 | 我們原本寫的專業術語 |
|---|---|
| 外掛打架、衝到 | 外掛相容性問題 |
| 跑版 | 版面錯亂、CSS 異常 |
| 搬家 | 網站遷移、migration |
| 轉圈圈、卡住 | 載入緩慢、逾時 |
| 掛掉、噴錯 | 服務中斷、fatal error |
左邊那欄才是客戶會打進搜尋框的字,右邊那欄是我們過去在寫的字。這張表直接改變了選題方向。從高頻提問句裡,我們排出一批確定有人在問的題目:LINE 推播沒送達、更新後網站崩潰、網站變慢怎麼診斷、金流串接卡關。這些不是我們猜的熱門主題,是客戶一年來真的一問再問的問題。
要補一句誠實話:客戶用語不會全部都有搜尋量,「衝到」這種太口語的詞,Google 上未必有人這樣搜,所以這張表不是終點,是種子,挖出種子字之後,下游還是要接回工具驗證。
接回下游:驗證搜尋量再排進寫作流程
種子字挖出來,我們把它接進既有的兩段流程。第一段是用 DataForSEO 做關鍵字研究,把每個候選字丟進去看實際搜尋量、難度和搜尋意圖,過濾掉沒量或難度太高的,這裡沿用我們一貫的標準:難度低於 40 優先,B2B 技術主題就算搜尋量掛零的長尾關鍵字也值得留,因為競爭低、轉化率高。
第二段是把整份客戶關鍵字庫嵌進我們的 AI 產文 Skill。這一步是為了讓它不要變成做完一次就躺在硬碟裡的分析報告。現在每次要寫新文章,AI 的第一個動作就是去這份關鍵字庫裡對照,看有沒有客戶真的在問這個主題、用的是哪個字。選題從「我們想寫什麼」變成「客戶在問什麼」,這個順序反過來,整條內容線的命中率就不一樣。
這個方法的三個前提
這套流程不是每個團隊拿去都能跑,它有明確的邊界:
- 要有足量的客戶對話。我們用了一年、清洗後 9,645 則。剛起步、還沒累積客服紀錄的團隊,種子字得先靠別的來源,例如社群提問或同業論壇。
- 對話品質決定產出品質。這批資料有價值,是因為它是認真的產品諮詢。如果對話大多是閒聊或一次性問句,抽出來的字參考性會下降。
- 隱私要先處理。客服對話含個資,我們在丟進分析前先雜湊掉客戶身分,過程中不輸出任何可辨識個人的內容。這是動工前就要定好的規則,不是事後補。
回到最開始那個落差:SEO 關鍵字研究做不準,很多時候不是工具不夠好,而是我們一直用自己的語言在猜客戶的語言。把種子字的來源從辦公室的白板換成客服的對話框,後面的搜尋量、選題、內容才有踩在真實需求上的機會。
延伸思考
這套方法建立在幾個前提上,值得再往下想:
- 客服對話有倖存者偏誤——來客服的人已經是客戶、而且願意開口問,他們的用詞不完全等於「還在 Google 找你的人」的用詞。種子字方向對,但覆蓋面偏向既有客群,潛在客戶與沉默用戶的語言挖不到。
- 中文斷詞失效是本地限制——這條在英文市場不成立,英文有成熟的 NLP 斷詞,但「客戶原音對不上專業術語」這個落差跨語言都在。
其他領域也有同樣的現象:
- 需求訪談的 Mom Test——「看客戶過去的行為,別問對未來的意見」。客服紀錄比訪談更純,連訪談者的引導偏差都沒有,是客戶卡住當下的原始反應。
- 產品設計的 VoC(客戶原音)——把客戶原話當一手素材做功能命名與介面用語,跟本文用客戶原話當種子字是同一套遷移。
常見問題
SEO 關鍵字研究一定要從客戶對話開始嗎?
不一定,但客戶對話是目前我們找過最準的種子字來源。如果還沒累積足夠的客服紀錄,可以先從社群平台的提問、同業論壇的討論串、甚至競品文章的留言區找客戶原始用語,重點是拿到客戶自己打的字,而不是我們假設他們會打的字。
為什麼不用傳統中文斷詞工具統計詞頻?
因為客服對話是口語,缺乏書面語的結構。標準斷詞會把「轉圈圈」「掛掉」這類真正有意義的口語詞稀釋掉,浮上來的反而是「可以」「這個」等功能詞。改用 AI 語義理解,並明確要求保留客戶原始用詞,才能抓到有分析價值的搜尋語言。
挖出來的客戶用語都能直接當關鍵字用嗎?
不能直接用。客戶用語是種子,太口語的詞未必有搜尋量。挖出種子字後還要接回關鍵字工具驗證實際搜尋量與難度,過濾掉沒量或競爭太高的,剩下的才是能寫的長尾關鍵字。
處理客戶對話會有隱私問題嗎?
會,所以要先處理。我們在分析前先雜湊客戶身分,過程中不輸出任何可辨識個人的資料。客服紀錄含個資,這條規則必須在動工前就定好,而不是事後才補。
想把自家的客服對話變成 SEO 選題來源,或需要一套從關鍵字研究到內容產出的完整流程?歡迎聯絡我們,或加入我們的 LINE 官方帳號聊聊你的專案。
Google 偏好來源
喜歡我們的內容嗎?一鍵將我們設為偏好來源,未來在 Google 焦點新聞與 AI 概覽中就能優先看到我們的文章。