抓取需要看的資料
例如商品價格、公告標題、名單、日期、連結、狀態欄位,把指定內容抓出來。
OFC Crawler Service
提供資料來源和想看的欄位,OFC 會把公開資料、商品價格、公告、名單或表格整理好。可以輸出成 Google Sheet、CSV、Email / Discord 通知,或做成一個簡單查詢頁。
DATA WORKFLOW
如果每天都要打開同一批網站,看價格有沒有變、公告有沒有更新、名單有沒有新增,OFC 可協助把這些步驟變成自動整理。
例如商品價格、公告標題、名單、日期、連結、狀態欄位,把指定內容抓出來。
可以每天、每週或固定時間檢查;有新增、下架、價格變動或關鍵字出現時發送通知。
資料可以整理到 Google Sheet、CSV、Excel,或做成簡單頁面,減少人工複製貼上。
BOUNDARY
會先確認這個來源適不適合自動化、資料量會不會太大、需不需要登入,以及有沒有官方 API 可以用。
公開網頁、公開公告、公開商品資訊、自有網站資料,或已具備權限可匯出的資料。
如果來源有官方 API、RSS、匯出檔或 webhook,會優先用這些方式,比硬抓網頁穩。
破解登入、繞過驗證、規避付費牆、抓私人資料、大量壓測,或明顯違反對方規則的需求。
去重、欄位比對、異常提醒、關鍵字通知、定期報表,或一個簡單後台查詢。
PROCESS
先用一小份資料確認方向,不會一開始就做很大。確認抓得到、格式也對,再設定固定更新和通知。
貼上資料來源、想看的欄位、多久更新一次,以及希望整理到哪裡。
會先確認來源是否公開、會不會常變、資料量合不合理,有沒有更穩的接法。
先整理一小份結果,確認欄位、格式和預期一致。
確認沒問題後,再設定多久跑一次、資料放哪裡、什麼情況要發送通知。
DATA PORTFOLIO
這裡放公開資料整理、自動擷取與輸出格式的案例。重點不是炫技,而是把原本分散在網站上的內容,整理成後續能查詢、分析或交給 AI 使用的資料。
使用 Python 與 Selenium 自動開啟公開網站,抓取首頁與內部頁面文字,整理成文字檔,後續可再轉成 CSV、Excel、搜尋資料庫或 AI 問答資料來源。
看 Colab 範例REQUEST FORM
貼上網址,說明想看哪些欄位、多久更新一次、要整理到哪裡。後續會先回覆能不能做,以及怎麼做比較穩。