據(jù)流到因子庫:量化因子研究的工程化收官之路)
做量化研究做到一定程度很多人會陷入一種“因子很多、策略很少”的尷尬回測里十幾個因子都有不錯的單調(diào)性可真要組合起來使用不是數(shù)據(jù)對不齊就是因子邏輯早已忘了當(dāng)初怎么算的更別說把它交給團(tuán)隊其他成員復(fù)現(xiàn)。如果你也卡在這個階段這篇文章想和你認(rèn)真聊聊因子階段的收官到底收的是什么。我的判斷是因子研究做到收官標(biāo)志不是“又多挖了幾個有效因子”而是你把從原始數(shù)據(jù)到因子值的整條鏈路理順了并且沉淀成了一個可查詢、可回溯、可復(fù)用的因子庫。換句話說研究能力要變成工程能力你的因子才算真正長在了自己的系統(tǒng)里。這篇文章會圍繞“從數(shù)據(jù)流到因子庫”這條主線展開先講清楚因子研究中的數(shù)據(jù)流到底長什么樣再走一遍因子計算、預(yù)處理、有效性檢驗的完整流程然后重點(diǎn)討論因子庫的存儲結(jié)構(gòu)、元數(shù)據(jù)設(shè)計和查詢語義最后給出工程化的最佳實(shí)踐和常見坑位。全文以 Python 生態(tài)為主涉及 pandas、numpy、statsmodels、scipy 等常用工具適合已經(jīng)有基礎(chǔ)因子研究經(jīng)驗、正在搭建自己量化研究框架的讀者。1. 這篇文章真正要解決的問題先拋一個場景。假設(shè)你現(xiàn)在要研究“過去20個交易日的收益率動量”這個因子最樸素的做法是寫一段腳本把行情數(shù)據(jù)讀進(jìn)來算一個收益率序列再按日期合并到標(biāo)的上。腳本跑完你得到一個 DataFrame看一眼 IC、分層收益覺得還行于是順手存成一個 CSV。問題來了三個月后你想把動量因子和另一個波動率因子放在一起做正交化發(fā)現(xiàn)兩份 CSV 的日期索引不一樣某只停牌股的缺失值處理方式也不一樣甚至動量因子當(dāng)時是用“前復(fù)權(quán)價格”算的波動率因子用的是“不復(fù)權(quán)價格”。你花了一晚上排查最后崩潰地發(fā)現(xiàn)根本沒法直接對比。這個場景在量化研究里太常見了。它暴露的不是某個因子的計算錯誤而是整個研究流程缺少“數(shù)據(jù)流”的約束。所謂“從數(shù)據(jù)流到因子庫”本質(zhì)上是把因子研究拆成一條可重復(fù)執(zhí)行的流水線原始行情數(shù)據(jù) → 統(tǒng)一清洗與對齊 → 因子計算 → 因子預(yù)處理 → 有效性檢驗 → 因子入庫 → 查詢與使用每一步都有明確的輸入和輸出每一步的中間結(jié)果可以被追溯和復(fù)現(xiàn)。這樣因子研究就不再是一次性腳本而是一個可積累的資產(chǎn)。這篇文章適合誰主要是兩類人。一類是剛把單個因子研究跑通的個人研究者需要建立更系統(tǒng)的框架另一類是小團(tuán)隊里負(fù)責(zé)研究基礎(chǔ)設(shè)施的開發(fā)者需要為投研同學(xué)設(shè)計一套簡單的因子管理方案。前者可以重點(diǎn)看數(shù)據(jù)流和因子預(yù)處理的思路后者可以重點(diǎn)看因子庫設(shè)計和查詢語義的部分。2. 因子、數(shù)據(jù)流、因子庫的概念邊界在深入實(shí)操之前有幾個概念需要先對齊因為它們很容易被混用。因子在量化研究里通常指一個可計算的橫截面特征它試圖用某個維度的信息來解釋或預(yù)測資產(chǎn)未來收益的差異。動量因子、波動率因子、估值因子都是典型例子。一個因子本質(zhì)上是一個“股票-日期”維度的數(shù)值表每一行代表某只股票在某個截面上的因子值。數(shù)據(jù)流在因子研究里指的是因子從原始數(shù)據(jù)到最終使用值的流動過程。它不是一條從 A 到 B 的直線而是有多條支路行情數(shù)據(jù)、財務(wù)數(shù)據(jù)、另類數(shù)據(jù)各有各的清洗邏輯最后要在統(tǒng)一的時間截面上對齊。之所以強(qiáng)調(diào)數(shù)據(jù)流是因為因子研究中 70% 以上的錯誤都出在“對齊”上而不是因子公式本身。因子庫則是把經(jīng)過驗證的因子以結(jié)構(gòu)化方式存儲、管理、檢索的系統(tǒng)。它可以簡單到一張規(guī)范設(shè)計的數(shù)據(jù)庫表也可以復(fù)雜到一套帶版本管理、權(quán)限控制、自動更新任務(wù)的完整服務(wù)。對于個人研究者起步階段不需要上重型系統(tǒng)但至少要有一套穩(wěn)定的存儲規(guī)范和查詢接口。這三者的關(guān)系可以這樣理解數(shù)據(jù)流是過程因子是產(chǎn)物因子庫是沉淀產(chǎn)物的倉庫。沒有數(shù)據(jù)流的約束因子就是一次性的臨時結(jié)果沒有因子庫的沉淀數(shù)據(jù)流跑得再順成果也無法復(fù)用。這里還要提一下“因子圖優(yōu)化”這個詞。它在很多語境里指圖神經(jīng)網(wǎng)絡(luò)中特征或因子關(guān)系的自動優(yōu)化屬于機(jī)器學(xué)習(xí)與圖計算的交叉方向。但從量化研究的角度看它的核心思想同樣可以借用因子之間不是孤立的它們存在相關(guān)性、冗余性和互補(bǔ)性因子庫的元數(shù)據(jù)設(shè)計如果能記錄因子間的關(guān)聯(lián)關(guān)系未來做因子篩選和組合時就會高效很多。這篇文章不會展開講圖優(yōu)化本身但會在因子庫設(shè)計中預(yù)留“因子關(guān)系描述”的字段方便后續(xù)擴(kuò)展。3. 環(huán)境準(zhǔn)備與前置條件這篇文章的示例代碼以 Python 為主建議使用 Python 3.9 以上版本。核心依賴如下pandas數(shù)據(jù)處理與截面操作的主力工具numpy數(shù)值計算scipy統(tǒng)計檢驗例如單因子方差分析 F 檢驗statsmodels回歸分析、中性化殘差提取SQLite/MySQL因子庫存儲示例使用 SQLite 方便本地驗證版本請以實(shí)際項目為準(zhǔn)本文重點(diǎn)演示通用思路。如果你的環(huán)境里已經(jīng)安裝了 Anaconda 或 Miniconda可以直接創(chuàng)建虛擬環(huán)境conda create -n quant_factor python3.10 conda activate quant_factor pip install pandas numpy scipy statsmodels sqlalchemy如果你的機(jī)器是 ARM 架構(gòu)的 Mac或者某些 Python 版本對 statsmodels 的依賴有兼容問題可能會出現(xiàn)安裝失敗。這時候建議優(yōu)先使用 conda 安裝 statsmodels因為它會自動處理底層 BLAS 庫的依賴。還需要說明的是本文的數(shù)據(jù)集使用模擬數(shù)據(jù)演示流程。真實(shí)的量化研究通常需要接入日線行情、分鐘行情、財務(wù)數(shù)據(jù)等數(shù)據(jù)源但“數(shù)據(jù)源長什么樣”并不是數(shù)據(jù)流的核心難點(diǎn)核心難點(diǎn)在于統(tǒng)一的清洗和對齊規(guī)范。所以本文的示例代碼會刻意把數(shù)據(jù)源模擬成統(tǒng)一格式的 DataFrame方便你聚焦在數(shù)據(jù)流設(shè)計上。4. 從原始數(shù)據(jù)到因子值核心流程拆解因子計算看起來是“寫個公式就出結(jié)果”但放進(jìn)數(shù)據(jù)流視角后你會發(fā)現(xiàn)它至少包含四個子步驟原始數(shù)據(jù)清洗、因子值計算、截面對齊與缺失值處理、因子預(yù)處理。4.1 原始數(shù)據(jù)清洗與標(biāo)準(zhǔn)化無論因子邏輯多復(fù)雜第一步都是拿到干凈的行情數(shù)據(jù)。常見的問題包括停牌導(dǎo)致的缺失行、除權(quán)除息導(dǎo)致的價格跳變、異常成交量、重復(fù)日期索引。這里的處理原則是清洗邏輯必須統(tǒng)一不能每個因子各洗各的。比如復(fù)權(quán)方式全庫應(yīng)該統(tǒng)一使用某一種價格序列。實(shí)際研究中趨勢類因子更常用前復(fù)權(quán)價格估值類因子可能要用到未復(fù)權(quán)價格和財務(wù)數(shù)據(jù)配合但入庫前至少要明確記錄使用的是哪種價格。下面是一個基礎(chǔ)清洗示例# 文件路徑data_cleaner.py import pandas as pd def clean_daily_price(df: pd.DataFrame) - pd.DataFrame: 清洗日線行情數(shù)據(jù)。 輸入必須包含列symbol, trade_date, close, volume 輸出按 symbol trade_date 排序、無重復(fù)索引的 DataFrame df df.copy() df[trade_date] pd.to_datetime(df[trade_date]) # 去重同一標(biāo)的同一交易日只保留一條 df df.drop_duplicates(subset[symbol, trade_date], keeplast) # 排序保證后續(xù)計算依賴時間順序 df df.sort_values([symbol, trade_date]).reset_index(dropTrue) # 剔除價格為空的記錄 df df.dropna(subset[close]) return df這一段代碼看起來簡單但它確定了一個非常重要的約定所有因子計算腳本接收的都應(yīng)該已經(jīng)是這個格式的行情數(shù)據(jù)。這樣動量因子、波動率因子、量價因子都從同一個清洗后的輸入開始避免了“各算各的、各錯各的”的問題。4.2 因子值計算清洗完成后就可以做因子計算了。這里的關(guān)鍵設(shè)計是“因子計算函數(shù)只做一件事輸入干凈的行情或財務(wù)數(shù)據(jù)輸出因子值”。以 20 日動量因子為例# 文件路徑factor_momentum.py import pandas as pd def calc_momentum(price: pd.Series, window: int 20) - pd.Series: 計算動量因子過去 window 日的累計收益率。 return price / price.shift(window) - 1.0 def build_momentum_factor(clean_df: pd.DataFrame, window: int 20) - pd.DataFrame: 基于清洗后的日線數(shù)據(jù)生成 momentum 因子值表。 返回 DataFramecolumns [symbol, trade_date, momentum] records [] for symbol, group in clean_df.groupby(symbol): group group.sort_values(trade_date) group[momentum] calc_momentum(group[close], window) records.append(group[[symbol, trade_date, momentum]]) result pd.concat(records, ignore_indexTrue) return result這段代碼在工程上有一個明顯的性能問題用 groupby 循環(huán)逐只股票計算在幾百只股票、幾千個交易日的數(shù)據(jù)量下勉強(qiáng)能跑但數(shù)據(jù)量上去后會非常慢。實(shí)際項目中更推薦用 pandas 的 groupby transform 或者直接用向量化操作。示例代碼刻意保留循環(huán)是為了讓邏輯更直白真正落地時你可以把它替換成更高效的實(shí)現(xiàn)。4.3 截面對齊與缺失值處理因子值算出來后會得到一個長表每一行是一個“股票-日期”對。但研究因子時我們更經(jīng)常需要的是“寬表”每一行是一個交易日每一列是一只股票單元格是因子值。為什么要轉(zhuǎn)成寬表因為很多檢驗方法比如分層回測、IC 計算天然要求按截面對齊。# 文件路徑factor_alignment.py import pandas as pd def pivot_factor(factor_long: pd.DataFrame, factor_name: str factor) - pd.DataFrame: 將因子長表轉(zhuǎn)成寬表。 輸入symbol, trade_date, factor 三列 輸出index 為 trade_datecolumns 為 symbol wide factor_long.pivot_table( indextrade_date, columnssymbol, valuesfactor_name ) # 按時間升序排列 wide wide.sort_index() return wide轉(zhuǎn)成寬表后缺失值處理就變成一個必須正面回答的問題。因子值的缺失通常來自三種情況股票停牌當(dāng)天沒有交易數(shù)據(jù)。計算窗口不足比如上市不滿 20 天的股票無法計算 20 日動量。數(shù)據(jù)源本身缺失。不同情況應(yīng)該有不同的處理方式但在因子研究階段統(tǒng)一的做法是先不去填充而是在檢驗時顯式跳過缺失值。如果強(qiáng)行填充比如用 0 填充很可能會引入虛假信息讓檢驗結(jié)果失真。這一點(diǎn)在后面的常見問題里還會展開。4.4 因子預(yù)處理去極值、中性化、標(biāo)準(zhǔn)化截面因子值直接使用會帶來兩個問題極端值主導(dǎo)統(tǒng)計量、風(fēng)格暴露干擾判斷。所以因子入庫和檢驗前一般會做三步預(yù)處理。去極值是為了消除異常值影響常用的方法是分位數(shù)截斷或 MAD絕對中位差法。下面給出一個基于百分位數(shù)的去極值實(shí)現(xiàn)# 文件路徑factor_preprocess.py import numpy as np import pandas as pd def winsorize_series(s: pd.Series, lower: float 0.01, upper: float 0.99) - pd.Series: 對橫截面序列做分位數(shù)去極值。 q_lower s.quantile(lower) q_upper s.quantile(upper) return s.clip(lowerq_lower, upperq_upper)中性化是剔除因子與某些風(fēng)險因子通常包括市值、行業(yè)有時也包括風(fēng)格因子之間的線性相關(guān)性。這一步的目的是讓“因子值”更干凈地反映它自身的信息增量。中性化通常用線性回歸取殘差來實(shí)現(xiàn)# 文件路徑factor_preprocess.py import statsmodels.api as sm def neutralize_factor( factor_wide: pd.DataFrame, market_cap_wide: pd.DataFrame, industry_dummies: pd.DataFrame ) - pd.DataFrame: 對因子值做橫截面中性化返回殘差作為新因子值。 這里以市值和行業(yè)虛擬變量作為中性化變量。 dates factor_wide.index result pd.DataFrame(indexdates, columnsfactor_wide.columns, dtypefloat) for dt in dates: y factor_wide.loc[dt] x pd.DataFrame(indexy.index) # 市值做對數(shù)處理更接近正態(tài) x[log_market_cap] np.log(market_cap_wide.loc[dt]) # 行業(yè)虛擬變量這里假設(shè) industry_dummies 是 MultiIndex 寬表 x pd.concat([x, industry_dummies.loc[dt]], axis1) # 去掉 y 或 x 中有缺失的股票 valid y.notna() x.notna().all(axis1) if valid.sum() 10: continue y_valid y[valid].astype(float) x_valid sm.add_constant(x[valid]) model sm.OLS(y_valid, x_valid).fit() result.loc[dt, valid] model.resid return result中性化是一個經(jīng)常被過度使用的步驟。如果因子本身就是要暴露市值風(fēng)格那中性化后會損失原始含義如果因子是純技術(shù)面選股因子中性化反而能提高和其他策略的疊加能力。這個選擇要取決于研究目標(biāo)而不是無腦照做。標(biāo)準(zhǔn)化是為了讓不同因子具有可比性。Z-score 是最常見的標(biāo)準(zhǔn)化方式# 文件路徑factor_preprocess.py def zscore_series(s: pd.Series) - pd.Series: 橫截面 Z-score 標(biāo)準(zhǔn)化。 return (s - s.mean()) / s.std()注意這里的均值、標(biāo)準(zhǔn)差都是在同一截面上計算的而不是滾動窗口。因為因子研究關(guān)心的是“橫截面可比性”不是時間序列的平穩(wěn)性。5. 因子有效性檢驗從 IC 到 F 檢驗因子算完、預(yù)處理完之后下一步是回答一個靈魂問題這個因子到底有沒有用這是“從數(shù)據(jù)流到因子庫”流程里最關(guān)鍵的質(zhì)檢關(guān)卡。沒有通過質(zhì)檢的因子不應(yīng)該進(jìn)入因子庫。5.1 分層回測與單調(diào)性最常用的檢驗方法是分層回測按每個截面的因子值大小分成 N 層統(tǒng)計每組在未來一段時間的平均收益觀察收益是否隨因子值單調(diào)變化。# 文件路徑factor_evaluate.py import pandas as pd import numpy as np def layer_returns( factor_wide: pd.DataFrame, forward_return: pd.DataFrame, n_layers: int 5 ) - pd.DataFrame: 按因子值分層計算每組未來收益均值。 forward_return: 寬表index 為 trade_datecolumns 為 symbol 值為未來持有期收益需要與 factor_wide 時間對齊。 result {} for dt in factor_wide.index: if dt not in forward_return.index: continue f factor_wide.loc[dt].dropna() ret forward_return.loc[dt] ret ret.reindex(f.index) valid f.notna() ret.notna() f f[valid] ret ret[valid] if len(f) n_layers * 2: continue # 按因子值排名分層0 為最小因子值組 ranks f.rank(methodfirst) layer pd.qcut(ranks, n_layers, labelsFalse) grouped ret.groupby(layer).mean() result[dt] grouped layer_table pd.DataFrame(result).T layer_table.columns [fL{i} for i in range(n_layers)] return layer_table如果 L5 組因子值最大的收益顯著高于 L1 組因子值最小并且中間各組大體單調(diào)那說明這個因子對收益有區(qū)分能力。如果 L1 和 L5 差異很大但中間亂跳則要警惕因子的非線性效應(yīng)或極端值影響。5.2 IC 與 IR分層回測直觀但需要一個簡潔數(shù)值來衡量整體預(yù)測能力這時就要算 IC。IC 有多種定義最常用的是 Rank IC即截面因子值和未來收益的 Spearman 秩相關(guān)系數(shù)。# 文件路徑factor_evaluate.py from scipy.stats import spearmanr def rank_ic_series(factor_wide: pd.DataFrame, forward_return: pd.DataFrame) - pd.Series: 逐截面計算 Rank IC。 dates factor_wide.index ic_list {} for dt in dates: if dt not in forward_return.index: continue f factor_wide.loc[dt] ret forward_return.loc[dt] valid f.notna() ret.notna() if valid.sum() 5: continue ic, _ spearmanr(f[valid], ret[valid]) ic_list[dt] ic return pd.Series(ic_list, namerank_ic)有了逐日 IC 序列之后可以進(jìn)一步計算 IC 的均值、標(biāo)準(zhǔn)差、ICIRIR。IR 的計算方式是 IC 均值除以 IC 標(biāo)準(zhǔn)差它衡量的是因子預(yù)測能力的穩(wěn)定性。如果一個因子 IC 均值為 0.05 但標(biāo)準(zhǔn)差也是 0.05IR 只有 1說明預(yù)測能力波動太大如果標(biāo)準(zhǔn)差只有 0.02IR 達(dá)到 2.5則說明因子比較穩(wěn)定。5.3 單因子方差分析 F 檢驗的應(yīng)用場景在因子檢驗里方差分析 F 檢驗經(jīng)常被提及但它更適合回答“分層收益之間是否存在顯著差異”這個問題而不是“因子是否有效”的全部答案。具體來說如果把每層的未來收益看作一組樣本那么可以用單因子方差分析檢驗這 N 組收益的均值是否存在顯著差異。零假設(shè)是各組均值相等如果 p 值很小說明至少有兩組的收益均值顯著不同因子對收益有分層效果。# 文件路徑factor_evaluate.py from scipy import stats def f_test_layers(layer_table: pd.DataFrame) - dict: 對分層收益做單因子方差分析 F 檢驗。 輸入 layer_table 為 DataFrame列是 L0..L4行是日期截面。 該函數(shù)檢驗各分層收益均值是否顯著不同。 groups [layer_table[col].dropna().values for col in layer_table.columns] # 過濾樣本過少的組 groups [g for g in groups if len(g) 3] f_stat, p_value stats.f_oneway(*groups) return { f_statistic: f_stat, p_value: p_value, layer_means: layer_table.mean().to_dict() }需要強(qiáng)調(diào)的是F 檢驗的結(jié)果只能說明“組間有差異”不能說明差異是單調(diào)的。一個因子可能讓 L1 和 L5 差異巨大但中間層毫無規(guī)律F 檢驗依然顯著。所以 F 檢驗應(yīng)該配合分層收益表一起看而不是單獨(dú)作為因子入庫的依據(jù)。5.4 未來函數(shù)檢查因子檢驗里最危險的錯誤不是統(tǒng)計方法選錯而是引入了未來函數(shù)。常見的是計算因子時誤用了當(dāng)天的收盤價而未來收益也是從當(dāng)天收盤價開始計算兩者在時間點(diǎn)上重疊導(dǎo)致 IC 虛高。解決方法是嚴(yán)格定義時間軸。假設(shè)因子值使用 T 日及之前的信息計算那因子值記為factor_t未來收益應(yīng)該是T1日到TN日的收益而不是從 T 日開始。換句話說T 日的因子值必須和 T 日的收益錯開使用。這一條聽起來簡單但實(shí)際操作中因為數(shù)據(jù)索引錯位導(dǎo)致的未來函數(shù)出現(xiàn)頻率極高。6. 因子庫設(shè)計與 SQL 實(shí)現(xiàn)當(dāng)因子通過了檢驗它就不再是一個臨時計算結(jié)果而是應(yīng)該進(jìn)入因子庫成為可復(fù)用的資產(chǎn)。因子庫設(shè)計的核心問題有三個存什么表、表結(jié)構(gòu)長什么樣、如何管理版本和元數(shù)據(jù)。6.1 因子庫表結(jié)構(gòu)設(shè)計從最簡方案出發(fā)一張核心的“因子值表”加上一張“因子元數(shù)據(jù)表”就足夠覆蓋個人研究者的需求。因子值表存儲每個因子在每個標(biāo)的每個交易日上的因子值采用窄表結(jié)構(gòu)。窄表雖然存儲空間更大但查詢和擴(kuò)展非常靈活新增一個因子不需要改表結(jié)構(gòu)。-- 文件路徑schema.sql CREATE TABLE IF NOT EXISTS factor_value ( factor_code VARCHAR(32) NOT NULL COMMENT 因子編碼如 momentum_20d, symbol VARCHAR(16) NOT NULL COMMENT 標(biāo)的代碼如 000001.SZ, trade_date DATE NOT NULL COMMENT 交易日, factor_value DOUBLE NULL COMMENT 因子值未標(biāo)準(zhǔn)化原始值, is_preprocessed TINYINT NOT NULL DEFAULT 0 COMMENT 是否已預(yù)處理0原始 1去極值 2中性化 3標(biāo)準(zhǔn)化, updated_at TIMESTAMP NOT NULL DEFAULT CURRENT_TIMESTAMP COMMENT 寫入時間, PRIMARY KEY (factor_code, symbol, trade_date, is_preprocessed) );不要把預(yù)處理后的因子值和原始因子值混在同一行里。原因是每次預(yù)處理都可能依賴不同的截面信息混在一起會讓“這個值到底怎么來的”變得難以追溯。更穩(wěn)妥的做法是把預(yù)處理版本作為一個獨(dú)立維度。因子元數(shù)據(jù)表記錄因子的基本信息和計算口徑-- 文件路徑schema.sql CREATE TABLE IF NOT EXISTS factor_meta ( factor_code VARCHAR(32) PRIMARY KEY COMMENT 因子編碼, factor_name VARCHAR(128) NOT NULL COMMENT 因子名稱, category VARCHAR(32) COMMENT 因子分類momentum/volatility/value/quality, formula TEXT COMMENT 因子計算邏輯描述, data_source VARCHAR(255) COMMENT 數(shù)據(jù)來源說明, rebalance_freq VARCHAR(16) COMMENT 調(diào)倉頻率daily/weekly/monthly, author VARCHAR(64) COMMENT 創(chuàng)建人, version VARCHAR(16) COMMENT 版本號, status VARCHAR(16) DEFAULT active COMMENT 狀態(tài)active/draft/deprecated, related_factors VARCHAR(255) COMMENT 關(guān)聯(lián)因子編碼逗號分隔可描述因子間關(guān)系, created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP, updated_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP ON UPDATE CURRENT_TIMESTAMP );這里我用related_factors字段來記錄因子間的關(guān)系。后續(xù)如果要做因子圖優(yōu)化或相關(guān)性聚類這個字段可以提供基礎(chǔ)的關(guān)系線索。6.2 從 DataFrame 寫入因子庫使用 SQLAlchemy 可以很方便地把 pandas DataFrame 寫入 SQLite# 文件路徑factor_store.py from sqlalchemy import create_engine def save_factor_to_db( factor_long: pd.DataFrame, factor_code: str, db_path: str factor_lib.db, is_preprocessed: int 0, if_exists: str append ) - None: 將因子長表寫入因子庫。 engine create_engine(fsqlite:///{db_path}) df factor_long.copy() df[factor_code] factor_code df[is_preprocessed] is_preprocessed df[updated_at] pd.Timestamp.now() # 只保留必要列并重命名 df df[[factor_code, symbol, trade_date, factor, is_preprocessed, updated_at]] df df.rename(columns{factor: factor_value}) df.to_sql(namefactor_value, conengine, if_existsif_exists, indexFalse)寫入時需要注意if_exists參數(shù)。如果表里已經(jīng)有舊數(shù)據(jù)直接 append 可能會導(dǎo)致主鍵沖突。因此在寫入前應(yīng)該先判斷是否要覆蓋已有區(qū)間。比較穩(wěn)妥的做法是先刪除目標(biāo)因子在指定時間范圍內(nèi)的舊記錄再寫入新數(shù)據(jù)。這個過程可以放在事務(wù)里保證原子性。6.3 因子讀取與查詢語義因子庫建好后最重要的使用方式是從庫里按條件取數(shù)-- 查詢 momentum_20d 因子最近 30 個交易日的數(shù)據(jù) SELECT symbol, trade_date, factor_value FROM factor_value WHERE factor_code momentum_20d AND trade_date DATE(now, -30 day) ORDER BY trade_date, symbol;這里就引出一個查詢語義問題因子庫里存的應(yīng)該是“T 日因子值”還是“T 日可用因子值”如果按嚴(yán)格的數(shù)據(jù)流應(yīng)該是后者。也就是說因子值是 T 日收盤后計算出來的在 T1 日才可用。如果只用自然日期查詢很容易在回測中用到當(dāng)天收盤后才知道的因子值來預(yù)測當(dāng)天收益。這里的一個推薦做法是在入庫時就把“可用日期”顯式存出來而不是讓使用者做日期偏移。比如增加一列available_date等于因子值真正可以被使用的日期。這樣回測引擎只需要按available_date取數(shù)不需要每個人都記住“因子值要滯后一天”這個規(guī)則。不過為了不讓表結(jié)構(gòu)過度復(fù)雜個人研究者也可以在查詢時統(tǒng)一約定取 T 日因子值必須用于預(yù)測 T1 日及之后開始的收益禁止用于 T 日當(dāng)天收益。這個約定的關(guān)鍵是把它寫進(jìn)代碼規(guī)范和文檔而不是靠每個人自覺。7. 完整示例把流程串起來為了讓你更直觀地理解“從數(shù)據(jù)流到因子庫”的完整鏈路這里用一個模擬數(shù)據(jù)腳本把整個流程串起來。假設(shè)我們有 30 只股票、500 個交易日的模擬行情數(shù)據(jù)。# 文件路徑run_pipeline.py import numpy as np import pandas as pd from data_cleaner import clean_daily_price from factor_momentum import build_momentum_factor from factor_preprocess import winsorize_series, zscore_series from factor_evaluate import rank_ic_series from factor_store import save_factor_to_db # 1. 生成模擬行情數(shù)據(jù) np.random.seed(42) dates pd.bdate_range(2023-01-02, 2024-12-01) symbols [f{i:06d}.SZ for i in range(1, 31)] records [] for sym in symbols: base np.random.randn() * 5 20 for dt in dates: ret np.random.randn() * 0.02 close base * (1 ret) records.append({symbol: sym, trade_date: dt, close: close, volume: np.random.rand() * 1e6}) raw_df pd.DataFrame(records) # 2. 清洗 clean_df clean_daily_price(raw_df) # 3. 計算因子 factor_long build_momentum_factor(clean_df, window20) factor_long factor_long.rename(columns{momentum: factor}) # 4. 轉(zhuǎn)寬表并做截面預(yù)處理 factor_wide factor_long.pivot_table(indextrade_date, columnssymbol, valuesfactor) factor_wide factor_wide.sort_index() factor_wide_clean factor_wide.apply(winsorize_series, axis1) factor_wide_z factor_wide_clean.apply(zscore_series, axis1) # 5. 計算未來 5 日收益模擬 forward return close_wide clean_df.pivot_table(indextrade_date, columnssymbol, valuesclose).sort_index() forward_ret close_wide.shift(-5) / close_wide - 1.0 # 6. 檢驗 IC ic rank_ic_series(factor_wide_z, forward_ret) print(IC 均值:, ic.mean()) print(IC 標(biāo)準(zhǔn)差:, ic.std()) print(IR:, ic.mean() / ic.std()) print(IC0 比例:, (ic 0).mean()) # 7. 入庫這里以預(yù)處理后的因子值為例 factor_wide_z.reset_index().melt(id_varstrade_date, var_namesymbol, value_namefactor) save_factor_to_db( factor_long..., factor_codemomentum_20d_zscore, db_pathfactor_lib.db, is_preprocessed3 )注意上面第 7 步里我留了一個省略號。實(shí)際使用時你需要把melt之后的長表賦給變量再傳給save_factor_to_db。原因是save_factor_to_db期望的是包含factor列的長表而melt之后默認(rèn)列名是value需要改名。這個示例跑通后你就擁有了一條最小的“數(shù)據(jù)流 → 因子 → 檢驗 → 入庫”鏈路。之后每新增一個因子只需要按照同樣的模板寫計算函數(shù)和處理邏輯。8. 常見問題與排查思路因子研究和因子庫建設(shè)過程中有幾個坑值得單獨(dú)拿出來講。問題現(xiàn)象可能原因排查方式解決方案因子 IC 高得離譜引入了未來函數(shù)因子值和收益時間重疊檢查因子計算最后一個輸入數(shù)據(jù)日期與收益起始日因子值統(tǒng)一滯后一天使用入庫時增加可用日期字段不同因子合并后數(shù)據(jù)對不齊各因子使用了不同復(fù)權(quán)方式、不同清洗邏輯檢查各因子入庫的元數(shù)據(jù)記錄統(tǒng)一數(shù)據(jù)清洗層所有因子共用同一份清洗后行情因子值缺失比例過高上市時間短、停牌、計算窗口不足統(tǒng)計各截面缺失率設(shè)置合理的缺失率閾值檢驗時排除缺失過多的標(biāo)的同一因子兩次入庫結(jié)果不同數(shù)據(jù)源更新導(dǎo)致歷史數(shù)據(jù)變化對比兩次計算結(jié)果差異區(qū)間建立數(shù)據(jù)版本快照機(jī)制因子計算鎖定數(shù)據(jù)版本因子入庫后查詢性能差窄表無索引或查詢范圍過大查看執(zhí)行計劃按 factor_code 和 trade_date 建聯(lián)合索引預(yù)處理前后因子值混用庫中同一因子存在多套預(yù)處理版本檢查 is_preprocessed 字段強(qiáng)制查詢時指定預(yù)處理版本或拆分成獨(dú)立表分層收益 F 檢驗顯著但多空組合不賺錢分層差異來自極端組中間層不單調(diào)查看分層收益表每層均值增加單調(diào)性判斷不只依賴 F 檢驗這里特別想展開說一下“數(shù)據(jù)源更新導(dǎo)致因子結(jié)果不同”這個坑。在真實(shí)量化研究中行情數(shù)據(jù)是會被修正的。比如某天某只股票發(fā)生了除權(quán)數(shù)據(jù)商可能會回溯調(diào)整歷史價格。如果你的因子計算沒有鎖定數(shù)據(jù)版本下一次重算時歷史因子值就會變化這會讓因子庫里的歷史記錄和新的計算結(jié)果產(chǎn)生沖突。解決思路是要么存儲因子值時就同時記錄數(shù)據(jù)源版本號要么在重新計算因子后把受影響的歷史區(qū)間整體覆蓋并更新元數(shù)據(jù)里的版本號。對于個人研究者第二條路更簡單但一定要在建庫時把updated_at和version字段留好。9. 從因子庫到因子平臺工程化最佳實(shí)踐如果你已經(jīng)把“從數(shù)據(jù)流到因子庫”的鏈路跑通接下來就需要考慮工程化的穩(wěn)定性問題。這里給出幾條實(shí)踐建議。第一條把因子計算做成可配置的流水線。每個因子不僅是“一個函數(shù)”而應(yīng)該是一個配置項。配置項里包含因子編碼、依賴的數(shù)據(jù)表、計算函數(shù)入口、預(yù)處理方式、檢驗閾值、入庫目標(biāo)表。這樣新增一個因子時你只需要增加一條配置而不是復(fù)制粘貼一整套腳本。# 文件路徑factors_config.yaml factors: - code: momentum_20d name: 20日動量 module: factor_momentum function: build_momentum_factor params: window: 20 preprocess: winsorize: true neutralize: false zscore: true validation: min_ic: 0.03 min_ir: 1.5第二條因子的入庫過程要有冪等性。同一份因子數(shù)據(jù)重復(fù)入庫不應(yīng)該產(chǎn)生重復(fù)記錄或沖突。實(shí)現(xiàn)方式有兩種寫入前刪除目標(biāo)區(qū)間的舊數(shù)據(jù)或者使用INSERT OR REPLACE。對于支持事務(wù)的數(shù)據(jù)庫推薦用事務(wù)包裹“刪除寫入”兩個步驟。第三條預(yù)處理邏輯要可復(fù)現(xiàn)。去極值用的分位數(shù)、中性化用的市值和行業(yè)數(shù)據(jù)這些都應(yīng)該在元數(shù)據(jù)里記錄。否則三個月后看到某個因子的 zscore 值你根本不知道它在哪個截面上做的標(biāo)準(zhǔn)化。一個設(shè)計良好的因子庫應(yīng)該能回答“這個值是怎么算出來的”這個問題。第四條安全邊界和權(quán)限管理。雖然個人研究者的因子庫通常只有自己使用但如果你在團(tuán)隊里搭建因子平臺就要考慮權(quán)限問題。建議至少區(qū)分三個角色因子計算者可以寫入和修改、策略研究者可以查詢和下載、系統(tǒng)管理員管理元數(shù)據(jù)和清理數(shù)據(jù)。不要讓所有人的代碼都直接連數(shù)據(jù)庫寫數(shù)據(jù)中間應(yīng)該有一層統(tǒng)一的數(shù)據(jù)訪問服務(wù)。第五條關(guān)注數(shù)據(jù)質(zhì)量監(jiān)控。因子庫不能只進(jìn)不出。建議定期跑一遍質(zhì)量監(jiān)控腳本檢查每個因子近期的缺失率、覆蓋度、均值和標(biāo)準(zhǔn)差是否有異常漂移。如果某一天某個因子的截面均值突然從 0.1 跳到 0.8很可能是數(shù)據(jù)源或計算邏輯出了問題。第六條為未來擴(kuò)展留接口。因子的研究對象不會永遠(yuǎn)停留在單一資產(chǎn)類別。如果你的因子庫從股票擴(kuò)展到期貨、轉(zhuǎn)債字段設(shè)計上需要預(yù)留資產(chǎn)類別標(biāo)識。另外如果未來要做機(jī)器學(xué)習(xí)因子挖掘生成的因子往往數(shù)量很多這時候因子庫就要支持批量注冊和批量更新而不是手工編寫每一條元數(shù)據(jù)。10. 階段收官該收拾的不只是代碼還有認(rèn)知回到文章最初的問題因子階段收官收的是什么從技術(shù)層面看是從數(shù)據(jù)流到因子庫的整條鏈路跑通。從認(rèn)知層面看是建立了一個很重要的判斷因子研究的核心資產(chǎn)不是某一個神奇因子而是把原始數(shù)據(jù)穩(wěn)定地加工成可驗證、可復(fù)用、可組合的因子資產(chǎn)的流水線能力。如果你正在做量化的第 90 天、第 200 天或者已經(jīng)有一堆因子腳本散落在各個 notebook 里這篇文章的建議是停下手頭繼續(xù)挖新因子的沖動先花一到兩周時間把已有的因子整理進(jìn)一個規(guī)范化的因子庫。這個動作看起來是在做“后勤工作”但它會顯著提升你后續(xù)研究的效率。你會發(fā)現(xiàn)很多以前需要重復(fù)排查的問題在因子庫建好之后自動消失了很多以前無法組合的因子現(xiàn)在只需要一次 JOIN 就能拿到對齊后的數(shù)據(jù)。接下來的學(xué)習(xí)方向可以沿著兩條線繼續(xù)深入。一條是因子組合與篩選方向基于因子庫做相關(guān)性聚類、正交化、因子合成這是“因子圖優(yōu)化”落地的實(shí)際場景另一條是數(shù)據(jù)流自動化方向把從數(shù)據(jù)清洗到因子入庫的過程做成定時任務(wù)和監(jiān)控告警讓因子庫成為真正可以支撐實(shí)盤研究的基礎(chǔ)設(shè)施。從數(shù)據(jù)流到因子庫不只是代碼層面的重構(gòu)更是研究思維的工程化升級。這一步邁過去量化研究才算真正進(jìn)入下一階段。