YayJun
LOADING
文件散落各目錄 → 自然語言提問,答案附資料來源,串流回應。
我的角色|主導開發:RAG Pipeline 設計(Chunking 策略、三路向量搜尋與加權合併)、後端實作與檢索品質調校。
THE PROBLEM / 問題與情境
多套
文件散落在不同目錄,同一份規範可能存在好幾個版本。
逐份
只能靠檔名與關鍵字翻找,換句話說或中英夾雜就搜不到。
無出處
就算問到答案也不知道依據哪份文件,沒人敢直接拿來使用。
THE SOLUTION / 解決方案
01 匯入
離線多格式統一
PDF、Office、圖片統一轉成文字與中繼資料。
02 切割
離線LLM 智能切割
依語意邊界切片,失敗時回退規則切割,再寫入索引。
03 關鍵
線上三路檢索 + 加權合併
語意、關鍵字、標題並行查詢,去重後重新排序。
04 回答
線上串流並附出處
SSE 逐字回傳,答案一律標註來源文件。
ARCHITECTURE / 系統架構
來源層
處理層
提問端
接入層
索引層・兩軌交會
檢索層・三路並行
加權合併排序
去重・分數正規化・權重調校
生成層
INTERACTIVE DEMO / 互動演示
可互動輸入問題
自然語言提問,先做查詢改寫與向量化
三路檢索
語意、關鍵字、標題三路並行查詢
加權合併
去重後依權重重新排序取前段
串流回答
以 SSE 逐字回傳並附上出處
同事提問 / 合成資料
檢索與回答
待機中從左邊選一則提問,四個步驟會依序點亮,最後產出附出處的答案。
加權合併後排序
三日以上須經部門主管與處級主管兩關簽核…
送出前須指定代理人,代理人需為同部門…
自 2025/12 起兩日以內改為單關簽核…
串流回答
答案一律附出處,查不到依據時回覆「查無相關文件」而不臆測。
加權合併後排序
由專案負責人於資產系統提出,註明用途與預計歸還日…
預設僅開放唯讀,需額外權限者另附主管核准…
測試機僅能存取測試區網段,不得連線正式資料庫…
串流回答
答案一律附出處,查不到依據時回覆「查無相關文件」而不臆測。
加權合併後排序
涉及個資者列為 P1,須於 1 小時內通報資安窗口…
第一時間通報資安信箱與值班主管,不得先行對外回應…
僅告知已受理並轉專責單位,不承諾原因與時程…
串流回答
答案一律附出處,查不到依據時回覆「查無相關文件」而不臆測。
本頁為去識別化整理,不含前雇主原始碼或資料;文件名稱與片段皆為前端合成資料。
TECHNOLOGY & DESIGN DECISIONS / 技術選型與設計決策
ALTERNATIVE CONSIDERED
為何不用單一向量檢索,而做三路加權合併?
單一向量檢索對「換句話說」表現很好,但企業文件充滿內部縮寫,這些詞不在 embedding 模型的詞彙裡,語意搜尋幾乎抓不到。三路並行讓各自補上對方的盲區,再以正規化後的加權合併排序,多一層排序邏輯與權重調校成本,換到的是專有名詞與口語提問效果都能明顯提升。
CHALLENGES & RESULTS / 挑戰與成果
挑戰 01
專有名詞查不到
企業內部專屬名詞,改由關鍵字路補齊,切片時保留原文不做正規化。
挑戰 02
切割破壞語意邊界
以 LLM 依語意切割並保留標題階層,失敗或超長時回退規則切割再二次切分。
自然語言
用問的就好,不必先知道文件在哪。
答案附出處
每句話都能追回原始文件段落。
串流回應
SSE 逐字回傳,長答案不必空等。