據(jù)分析起步階段 checklist)
根據(jù) Anthropic 官方博客 How Anthropic enables self-service data analytics with Claude 提煉而成。用法按從上到下的順序一項(xiàng)項(xiàng)打勾。節(jié)奏參考階段 0 半天階段 1 約 1–2 周階段 2 持續(xù) 3–4 周不要跳步階段 3 也別提前動手術(shù)語約定canonical核心概念一個指標(biāo)唯一、說死的定義。比如收入到底取哪個表、什么口徑得先定下來。eval測試題一道問題 正確答案的題專門用來檢驗(yàn) AI 算得對不對。skill技能文檔一份說明告訴 AI 該按什么步驟去查數(shù)據(jù)。agent幫你跑分析的 AI 助手。前置開工前的五問決定投入多少[ ] Q1 今天 vs 未來哪個更重要為什么AI 模型更新很快。如果你是為了補(bǔ)當(dāng)前模型的短板才去搭基礎(chǔ)設(shè)施等模型一升級這些設(shè)施很可能就白費(fèi)了。先想清楚你要的是現(xiàn)在夠用就行還是長期穩(wěn)得住這決定了你到底要建多少東西。怎么算完成能說清楚自己選哪條路是賭模型會變好、先湊合著用還是先搭一套能盡量兜底的系統(tǒng)。[ ] Q2 業(yè)務(wù)復(fù)雜度未來會怎么變?yōu)槭裁慈绻麛?shù)據(jù)量不大、看數(shù)據(jù)的人不多、業(yè)務(wù)也不算復(fù)雜那大廠那套流程對你來說多半是多余的。怎么算完成能大致判斷未來一年數(shù)據(jù)量和問題復(fù)雜度會不會明顯往上走。[ ] Q3 看數(shù)據(jù)的人懂不懂?dāng)?shù)據(jù)為什么看結(jié)果的人如果自己能看出錯比如分析師本人用那出錯率高些也能接受驗(yàn)證可以省一點(diǎn)。反過來如果看結(jié)果的人根本不懂?dāng)?shù)據(jù)驗(yàn)證就必須做扎實(shí)不然錯了他也發(fā)現(xiàn)不了。怎么算完成能說清誰會看這些結(jié)果以及他能不能自己發(fā)現(xiàn)錯。[ ] Q4 愿意為準(zhǔn)確率花多少錢、忍受多少延遲為什么有些提高準(zhǔn)確率的手段是要額外花錢、花時(shí)間的。比如 Anthropic 試過的對抗性審查準(zhǔn)確率只漲了 6%但 token 多耗 32%、響應(yīng)慢了 72%。怎么算完成心里大致有個數(shù)愿意花多少錢、能接受多長的響應(yīng)時(shí)間。[ ] Q5 數(shù)據(jù)隱私邊界在哪為什么給 AI 的上下文越全它答得越準(zhǔn)。但數(shù)據(jù)開放范圍越大就越容易踩到公司的管控紅線。這直接決定你是做一個能看全部數(shù)據(jù)的通用助手還是按權(quán)限拆成幾個分開的助手。怎么算完成能劃清一條線哪些數(shù)據(jù)可以給 AI 用哪些絕對不能碰。階段 0盤點(diǎn)[ ] 0.1 寫下你最常被問的 5–10 個數(shù)據(jù)問題為什么起步得從問題出發(fā)不是從數(shù)據(jù)出發(fā)。你最常被問到的這些問題就是整套體系的起點(diǎn)階段 1 定哪些核心概念、階段 2 出哪些測試題都得從這里往回推。Anthropic 自己也是先把日常最常被問的問題固化下來再搭后面的東西。怎么算完成清單上寫的都是具體問題比如上個月收入多少、哪個產(chǎn)品賣得最好、某客戶為什么流失而不是做個數(shù)據(jù)分析這種空話。[ ] 0.2 為每個問題標(biāo)注答案來源為什么先摸清楚底每個問題的答案到底出自哪張表、什么口徑、誰在管。這一步常常會暴露一個問題同一個問題往往有三四種算法而這正是后面要解決的概念說不清的根源。怎么算完成每個問題都能寫出至少一個答案來源。寫不出來的就是階段 1 要優(yōu)先處理的。[ ] 0.3 標(biāo)出你最痛的 3 類分析為什么先挑最痛的下手用它來決定階段 1 先定哪個核心概念。是反復(fù)返工最痛是口徑對不上老吵架最痛還是答完才發(fā)現(xiàn)用錯表最痛哪類最痛就先把它定成核心概念。怎么算完成能說出哪類分析最費(fèi)時(shí)間、最常出錯、最不敢拍板。階段 1最小三件套核心別貪多Anthropic 原話a handful of canonical datasets, a few dozen offline evals, and a thin knowledge skill will capture most of the upside.幾個核心數(shù)據(jù)集、幾十條測試題、一份薄的技能文檔就能拿到大部分收益。后面所有東西都是這三件建好之后才往上加的。[ ] 1.1 定義 5–10 個核心概念canonical每個綁定唯一源為什么這一步是在解決最容易出錯的根源也就是概念說不清。公司里收入常常有三四種算法不定死AI 和人就一直在猜。Anthropic 的做法是核心定義要少、要準(zhǔn)、而且要管嚴(yán)你搜一個概念應(yīng)該只得到一個權(quán)威答案。怎么算完成每個概念寫一頁紙用哪張表、哪一列、含不含稅、什么口徑、時(shí)間窗口怎么算。要落筆寫下來不能只存在腦子里。[ ] 1.2 寫一份薄的技能文檔knowledge skill為什么這一步把先查核心概念的權(quán)威定義查不到再去翻原始數(shù)據(jù)表這個順序固定下來免得 AI 在幾百萬個字段里瞎找它應(yīng)對的就是檢索失敗。Anthropic 自己測過沒有 skill 時(shí)準(zhǔn)確率不到 21%加上之后穩(wěn)定到 95% 以上。怎么算完成一份文檔能說清這個問題先看哪份定義查不到再看哪張?jiān)急怼2挥靡簧蟻砭筒鸪珊脦讉€文件先一份就夠。[ ] 1.3 建 20–30 條測試題eval每條釘死一個快照日期為什么起步階段能做的驗(yàn)證基本就是備好問題 正確答案的對照題。答案必須釘在一個固定的快照日期上因?yàn)槿绻阌玫氖菚兊膶?shí)時(shí)數(shù)字?jǐn)?shù)據(jù)一更新正確答案也跟著變題就廢了。Anthropic 管這叫標(biāo)準(zhǔn)答案不能漂移。怎么算完成每條題都寫全問題 快照日期 正確答案數(shù)字和口徑都寫。比如2026 年 6 月收入 1,234,567 元含稅口徑6 月 30 日快照。[ ] 1.4 核心概念文檔和測試題放同一目錄改動一起提交為什么這是 Anthropic 的共置原則改數(shù)據(jù)的同時(shí)文檔必須一起改。不然幾周下來文檔就和實(shí)際對不上了。他們實(shí)測過不維護(hù)的話離線準(zhǔn)確率一個月就能從 95% 掉到 65%原因就是沒人把維護(hù)當(dāng)回事。怎么算完成有一個統(tǒng)一目錄只要口徑或表結(jié)構(gòu)一改就同步更新對應(yīng)的核心概念頁和受影響的測試題。公司如果沒有自動化檢查就靠這條手動規(guī)矩兜著。階段 2驗(yàn)證閉環(huán)持續(xù)[ ] 2.1 每次回答后對照測試題檢查對錯為什么驗(yàn)證是唯一能讓你知道哪個環(huán)節(jié)還在出錯的辦法。不驗(yàn)證哪怕全套環(huán)境都搭好了你也說不清到底好不好用Anthropic 說這是很多團(tuán)隊(duì)都有的毛病。怎么算完成有一份AI 回答 vs 標(biāo)準(zhǔn)答案的對照記錄能說出最近的通過率。[ ] 2.2 答錯的題收成新測試題為什么每一次糾正都是一道現(xiàn)成的新測試題而且不要錢。題庫跑得越多越準(zhǔn)慢慢就積成了你的資產(chǎn)。Anthropic 在線驗(yàn)證里持續(xù)收集糾正用的也是這個思路。怎么算完成題庫數(shù)量每周在增加而不是一直停在原來的地方。[ ] 2.3 每份報(bào)告加來源腳注為什么這是防靜默失敗最劃算的辦法。靜默失敗指的是答案其實(shí)錯了但看著挺合理別人也沒多想就直接用了。腳注里寫清三件事數(shù)據(jù)來自哪一層核心定義 ? 參考文檔 ? 原始表、數(shù)據(jù)新到哪天、歸誰管??吹皆急?、新鮮度未知這種腳注轉(zhuǎn)發(fā)之前你得先自己核一遍。怎么算完成每份輸出都帶來源層級 新鮮度 歸屬這三樣。[ ] 2.4 每周復(fù)盤通過率形成時(shí)間序列為什么用來抓那種一點(diǎn)點(diǎn)變差的問題單次檢查看不出來得連著看幾周的趨勢。Anthropic 會把每次測試的結(jié)果都存下來版本、模型、通過率、token 用量都記這樣那個改動到底有沒有用就變成了一條能查的數(shù)據(jù)。怎么算完成有一份按周記錄的通過率曲線能看出走向而不是只盯某一次的數(shù)字。階段 3疊加增值基礎(chǔ)打穩(wěn)之后 · 可選[ ] 3.1 僅當(dāng)通過率卡住、且錯誤集中在某一類時(shí)才疊加為什么別為了好看而過度設(shè)計(jì)。如果老在內(nèi)部術(shù)語理解上出錯就補(bǔ)業(yè)務(wù)上下文層。如果老在復(fù)雜查詢邏輯上出錯就上對抗性審查準(zhǔn)確率 6%代價(jià)是多花 32% 的 token、響應(yīng)慢 72%。如果手動收集糾正太累就上自動收集。怎么算完成能說清自己卡在哪類錯誤上所以要補(bǔ)這一層。自檢全部勾選后你應(yīng)該能看到一份寫下來的高頻問題清單5–10 個 每個問題的答案來源。一份核心概念頁5–10 個概念每個綁唯一源和口徑。一份能指路的技能文檔。20–30 條釘死日期的測試題 每周通過率記錄。每份輸出都帶來源腳注。明確知道下一步該補(bǔ)哪一層或明確知道現(xiàn)在還不需要。歧義讓答案不唯一陳舊讓答案過期檢索失敗讓答案找不到。起步三件套正好對著這三個毛病。核心概念治歧義維護(hù)紀(jì)律治陳舊技能文檔治檢索失敗。