現(xiàn)Transformer時(shí)間序列預(yù)測(cè):從單步到多步的完整指南)
簡(jiǎn)介本資源是一套基于PyTorch實(shí)現(xiàn)的Transformer時(shí)間序列預(yù)測(cè)完整實(shí)驗(yàn)方案面向機(jī)器學(xué)習(xí)初學(xué)者與時(shí)間序列建模實(shí)踐者聚焦單步與多步預(yù)測(cè)兩大核心任務(wù)適用于氣象、能源、金融等領(lǐng)域的時(shí)序數(shù)據(jù)分析場(chǎng)景。壓縮包共10個(gè)文件3.21MB包含2個(gè)核心訓(xùn)練腳本transformer-singlestep.py與transformer-multistep.py、1個(gè)真實(shí)溫度數(shù)據(jù)集daily-min-temperatures.csv、1張預(yù)測(cè)效果可視化圖transformer-future200.png、1個(gè)動(dòng)態(tài)訓(xùn)練過程演示gifresult.gif、1份環(huán)境依賴說明requirements.txt及README文檔等結(jié)構(gòu)清晰、開箱即用。已有2909人學(xué)習(xí)下載所有代碼均經(jīng)實(shí)測(cè)可直接運(yùn)行附帶每日最低溫度數(shù)據(jù)上的100輪訓(xùn)練結(jié)果與多步預(yù)測(cè)對(duì)比分析便于讀者理解模型輸入構(gòu)造、位置編碼設(shè)計(jì)、掩碼機(jī)制應(yīng)用及輸出解碼邏輯是深入掌握Transformer在時(shí)序領(lǐng)域落地的優(yōu)質(zhì)實(shí)踐素材。 拿到一個(gè)時(shí)間序列預(yù)測(cè)需求時(shí)很多人第一反應(yīng)是先套LSTM。我一開始也是這么干的但項(xiàng)目數(shù)據(jù)拉長(zhǎng)到幾百個(gè)時(shí)間步后LSTM訓(xùn)練慢不說往后預(yù)測(cè)的曲線像一個(gè)被壓扁的彈簧越來越“平”。朋友建議試試Transformer我?guī)е鴮⑿艑⒁傻膽B(tài)度用Pytorch從零搭了一套單步和多步預(yù)測(cè)實(shí)驗(yàn)。沒想到的是模型把長(zhǎng)距離依賴抓得很穩(wěn)預(yù)測(cè)結(jié)果比LSTM明顯更貼合趨勢(shì)。這篇文章就是這次實(shí)驗(yàn)的記錄從為什么選Transformer、單步/多步怎么設(shè)計(jì)到Pytorch完整實(shí)現(xiàn)和踩坑實(shí)錄都會(huì)拆開講。適合已經(jīng)會(huì)上手Pytorch、但還沒用Transformer處理過時(shí)間序列的同學(xué)也適合做量化、銷量預(yù)測(cè)、設(shè)備監(jiān)測(cè)等場(chǎng)景的工程師參考。我會(huì)盡量把每個(gè)關(guān)鍵選擇背后的原因?qū)懬宄皇侵粊G代碼。1. 整體設(shè)計(jì)與思路拆解1.1 為什么用Transformer而不是LSTM在時(shí)間序列上做預(yù)測(cè)本質(zhì)上是在建模“過去的時(shí)間點(diǎn)如何影響未來”。LSTM和GRU的思路是遞歸地、逐步地把信息往后傳這種過程的優(yōu)點(diǎn)是參數(shù)少、可解釋性強(qiáng)但缺點(diǎn)也很明顯訓(xùn)練是串行的序列一長(zhǎng)梯度消失和長(zhǎng)期依賴丟失的問題就會(huì)顯現(xiàn)。Transformer的設(shè)計(jì)是直接計(jì)算序列中任意兩個(gè)位置之間的關(guān)聯(lián)度通過多頭注意力機(jī)制一次性看到全局信息。放在時(shí)間序列里這就意味著模型可以自己學(xué)會(huì)“第1個(gè)時(shí)間點(diǎn)對(duì)第50個(gè)時(shí)間點(diǎn)很重要”而不是像RNN那樣靠門控一路“背”過去。不過話說回來Transformer也不是沒有代價(jià)。它不像LSTM自帶順序概念必須靠位置編碼把順序信息硬塞進(jìn)輸入而且注意力矩陣的空間復(fù)雜度是O(n^2)窗口特別長(zhǎng)的時(shí)候會(huì)吃顯存。這決定了我們?cè)趯?shí)驗(yàn)里不能無腦堆窗口需要在數(shù)據(jù)長(zhǎng)度和模型容量之間做取舍。但總體上對(duì)于中等長(zhǎng)度幾十到幾百個(gè)時(shí)間點(diǎn)的時(shí)間序列Transformer的精度和訓(xùn)練效率都很有競(jìng)爭(zhēng)力。我在做實(shí)驗(yàn)對(duì)比時(shí)同一個(gè)數(shù)據(jù)切了兩份一份用兩層LSTM一份用兩層Transformer encoder。LSTM訓(xùn)練了接近200個(gè)epoch才收斂Transformer在100個(gè)epoch左右就已經(jīng)更好了尤其在后半段的預(yù)測(cè)曲線上Transformer更貼近原始趨勢(shì)。這其實(shí)不難理解時(shí)間序列里“之前一段時(shí)間的形態(tài)”往往比“最后一個(gè)點(diǎn)的值”更重要而注意力機(jī)制天生擅長(zhǎng)捕捉這種形態(tài)。1.2 單步預(yù)測(cè)和多步預(yù)測(cè)的差異單步預(yù)測(cè)是經(jīng)典的監(jiān)督學(xué)習(xí)任務(wù)輸入過去一段序列輸出下一個(gè)時(shí)間點(diǎn)的值。多步預(yù)測(cè)的難度要高一個(gè)檔次因?yàn)檩敵龅氖且粋€(gè)連續(xù)的未來區(qū)間不只是“下一個(gè)點(diǎn)”的精確值還要考慮未來多個(gè)點(diǎn)之間的疊加誤差。我在實(shí)驗(yàn)中分別實(shí)現(xiàn)了兩種多步方案這里先做一個(gè)直觀對(duì)比指標(biāo)直接多步遞歸多步實(shí)現(xiàn)復(fù)雜度輸出層維度設(shè)為horizon簡(jiǎn)單需要把預(yù)測(cè)值拼回輸入循環(huán)推理推理速度快一次forward得到K個(gè)點(diǎn)慢要連續(xù)forward K次誤差累積幾乎沒有因?yàn)镵個(gè)點(diǎn)同時(shí)輸出明顯越往后越偏訓(xùn)練難度需要同時(shí)擬合K個(gè)標(biāo)簽數(shù)據(jù)量小時(shí)難度大訓(xùn)練時(shí)仍是單步難度低適用場(chǎng)景horizon較大、訓(xùn)練數(shù)據(jù)充足小規(guī)??焖賹?shí)驗(yàn)、模型迭代期直接多步Direct Multi-stepTransformer輸出層的維度直接設(shè)為horizon長(zhǎng)度讓模型一次生成未來K個(gè)點(diǎn)。缺點(diǎn)是模型要同時(shí)擬合K個(gè)輸出訓(xùn)練難度高但推理快。遞歸多步Recursive Multi-step先用單步模型預(yù)測(cè)出下一個(gè)點(diǎn)再把這個(gè)預(yù)測(cè)值當(dāng)輸入滑進(jìn)窗口繼續(xù)預(yù)測(cè)下下個(gè)點(diǎn)。實(shí)現(xiàn)簡(jiǎn)單但誤差會(huì)隨著步數(shù)累積越往后越偏。還有一種Teacher Forcing的訓(xùn)練方式只在訓(xùn)練時(shí)用真實(shí)值替代預(yù)測(cè)值喂養(yǎng)模型推理時(shí)再用預(yù)測(cè)值這個(gè)后面在訓(xùn)練循環(huán)里會(huì)講。這兩個(gè)方案我都跑了也記錄了各自的loss曲線和誤差指標(biāo)。直接多步在horizon比較大時(shí)會(huì)比遞歸更穩(wěn)但前提是訓(xùn)練數(shù)據(jù)要充足遞歸多步在小樣本上更靈活適合快速迭代。建議你在自己的數(shù)據(jù)上都試試對(duì)比后再選。2. 核心細(xì)節(jié)解析與實(shí)操要點(diǎn)2.1 位置編碼不能省但不要照搬NLPTransformer本身沒有順序感。把序列順序打亂注意力算出來的結(jié)果是一模一樣的。所以位置編碼是Transformer做時(shí)序預(yù)測(cè)繞不開的基礎(chǔ)。NLP里常見的是正弦位置編碼把位置索引用sin/cos函數(shù)映射到embedding維度上。在時(shí)間序列里這個(gè)方式一樣能用但我測(cè)試下來直接把時(shí)間戳比如間隔、周幾、小時(shí)作為額外特征拼進(jìn)輸入效果往往更好尤其是數(shù)據(jù)有明顯周期性的場(chǎng)景。實(shí)用的做法是“加”而不是“拼”把正弦位置編碼加到輸入embedding上然后額外把標(biāo)準(zhǔn)化后的時(shí)間特征拼在輸入特征維度后面。這樣模型既能感知絕對(duì)位置也能感知周期性信息。代碼實(shí)現(xiàn)時(shí)位置編碼的維度要和d_model一致否則維度對(duì)不上沒法加。為什么要乘sqrt(d_model)這是Transformer原論文里的一個(gè)細(xì)節(jié)。輸入經(jīng)過embedding后數(shù)值范圍通常會(huì)比較小直接往上面加位置編碼位置信息很容易蓋過原始特征。乘上sqrt(d_model)相當(dāng)于把輸入embedding放大到和位置編碼一個(gè)量級(jí)讓兩者在相加時(shí)都能保留有效信息。我在實(shí)驗(yàn)里試過不乘這個(gè)系數(shù)訓(xùn)練loss收斂明顯變慢所以這個(gè)細(xì)節(jié)不建議省。2.2 數(shù)據(jù)預(yù)處理決定模型上限先講一個(gè)我踩過的坑一開始我直接用整個(gè)序列的均值和方差做歸一化訓(xùn)練loss很漂亮但測(cè)試特別差。后來才意識(shí)到這是把未來信息透漏給了訓(xùn)練過程也就是典型的數(shù)據(jù)泄漏。正確的做法是只在訓(xùn)練集上fit scaler再用同一套scaler去transform驗(yàn)證集和測(cè)試集?;瑒?dòng)窗口的構(gòu)造也值得細(xì)品。單步預(yù)測(cè)時(shí)每條樣本是[look_back, feature_dim]的輸入和[1]的標(biāo)簽多步預(yù)測(cè)時(shí)標(biāo)簽就變成[horizon]或者[horizon, feature_dim]。窗口長(zhǎng)度look_back一般取序列長(zhǎng)度的10%~20%不能太短也不能太長(zhǎng)。我常用look_back24或48來預(yù)測(cè)未來6~12個(gè)點(diǎn)效果比拍腦袋定的窗口好不少。另外如果數(shù)據(jù)有缺失不要用均值填充盡量用前向填充或插值避免引入錯(cuò)誤的局部趨勢(shì)。關(guān)于歸一化我一般用MinMaxScaler。它在數(shù)據(jù)有明顯上下界時(shí)非常穩(wěn)能讓模型更快收斂。StandardScaler也不是不行但對(duì)異常值更敏感。如果數(shù)據(jù)里有特別大的尖峰MinMax可能把正常值壓得太扁這時(shí)候可以先做一輪異常值截?cái)嘣儆谩2灰簧蟻砭桶阉袛?shù)據(jù)丟進(jìn)模型先畫圖看分布這個(gè)習(xí)慣能省掉后面很多麻煩。2.3 核心超參數(shù)怎么定才有得跑下面是這次實(shí)驗(yàn)里的核心超參數(shù)可以直接照抄參數(shù)數(shù)值說明d_model64輸入embedding和注意力投影的維度nhead4多頭注意力頭數(shù)需能被d_model整除num_encoder_layers2標(biāo)準(zhǔn)Transformer里encoder層數(shù)我用了2層dim_feedforward256前饋網(wǎng)絡(luò)隱藏層維度dropout0.1防止過擬合batch_size64顯存不大就調(diào)小建議32~128learning_rate1e-3初始學(xué)習(xí)率配合cosine調(diào)度epochs100早停耐心值建議設(shè)20注意nhead一定要能整除d_model否則Pytorch會(huì)直接報(bào)錯(cuò)。層數(shù)不是越多越好我試過4層在數(shù)據(jù)量不大的情況下反而更容易過擬合。學(xué)習(xí)率建議用AdamW 余弦退火Transformer對(duì)學(xué)習(xí)率比LSTM敏感固定學(xué)習(xí)率容易震蕩。dim_feedforward我習(xí)慣設(shè)成d_model的4倍左右太大參數(shù)量漲得快太小表達(dá)能力受限。還有一個(gè)常被忽略的參數(shù)是dropout。時(shí)間序列訓(xùn)練數(shù)據(jù)一般不會(huì)特別大dropout設(shè)太小容易過擬合設(shè)太大又可能欠擬合。0.1到0.2之間是個(gè)安全區(qū)間。如果你的數(shù)據(jù)量超過十幾萬條可以把dropout降到0.05加快收斂。3. 實(shí)操過程與核心環(huán)節(jié)實(shí)現(xiàn)3.1 環(huán)境搭建與項(xiàng)目結(jié)構(gòu)動(dòng)手前先把環(huán)境理順。我習(xí)慣用conda建一個(gè)獨(dú)立環(huán)境避免跟其他項(xiàng)目打架。conda create -n ts_transformer python3.9 -y conda activate ts_transformer pip install torch2.1.2 --index-url https://download.pytorch.org/whl/cu118 pip install numpy pandas matplotlib scikit-learn如果你用的是GPU機(jī)器裝完后第一時(shí)間檢查一下CUDA是否可用python -c import torch; print(torch.cuda.is_available(), torch.cuda.device_count())輸出“True 1”就說明Pytorch能用GPU了。如果輸出False不是驅(qū)動(dòng)問題就是Pytorch版本沒選對(duì)。我還在Jetson等嵌入式設(shè)備上裝過那又得單獨(dú)挑適配版本不建議新手一上來就碰。項(xiàng)目目錄我習(xí)慣這樣組織time_series_transformer/ ├── data.csv # 原始數(shù)據(jù) ├── dataset.py # 數(shù)據(jù)集與預(yù)處理工具 ├── model.py # Transformer模型定義 ├── train.py # 單步/多步訓(xùn)練腳本 ├── evaluate.py # 評(píng)估與可視化 └── requirements.txt這個(gè)結(jié)構(gòu)看著簡(jiǎn)單但足夠用。實(shí)驗(yàn)迭代時(shí)最怕把所有代碼堆在一個(gè)文件里改一個(gè)地方牽一發(fā)動(dòng)全身。把數(shù)據(jù)、模型、訓(xùn)練、評(píng)估拆開后面換數(shù)據(jù)集或者換模型會(huì)輕松很多。3.2 數(shù)據(jù)準(zhǔn)備與Dataset類為了把實(shí)驗(yàn)說透我用了一段周期信號(hào)疊加噪聲的數(shù)據(jù)模擬傳感器讀數(shù)或者銷量曲線。你也可以換成自己的csv只要確保日期列按時(shí)間升序排列。import numpy as np import pandas as pd from torch.utils.data import Dataset, DataLoader # 生成示例數(shù)據(jù)正弦 線性趨勢(shì) 噪聲 np.random.seed(42) t np.arange(0, 1200) signal 10 * np.sin(2 * np.pi * t / 50) salary t * 0.01 noise np.random.normal(0, 1, sizet.shape) data signal salary noise注意這個(gè)數(shù)據(jù)只是示例真正項(xiàng)目里數(shù)據(jù)要復(fù)雜得多但處理和建模邏輯是一樣的。這里我故意加了一個(gè)單調(diào)趨勢(shì)是想看Transformer能不能在趨勢(shì)和周期并存時(shí)學(xué)出結(jié)構(gòu)。接下來是滑動(dòng)窗口。我寫了一個(gè)繼承Dataset的類輸入是[look_back, feature_dim]序列標(biāo)簽是未來horizon個(gè)點(diǎn)。class TimeSeriesDataset(Dataset): def __init__(self, data, look_back24, horizon6, step1): self.x, self.y [], [] for i in range(0, len(data) - look_back - horizon 1, step): x data[i:i look_back] y data[i look_back:i look_back horizon] self.x.append(x) self.y.append(y) self.x np.array(self.x, dtypenp.float32) self.y np.array(self.y, dtypenp.float32) def __len__(self): return len(self.x) def __getitem__(self, idx): return self.x[idx], self.y[idx]需要注意這里的data是一維數(shù)組所以我構(gòu)建x時(shí)每個(gè)時(shí)間點(diǎn)只有1個(gè)特征。如果有多維特征沿著最后一個(gè)維度拼接即可上一節(jié)的“拼時(shí)間戳”也是在這里做。構(gòu)造好的樣本可以用DataLoader加載look_back, horizon 24, 6 dataset TimeSeriesDataset(data, look_back, horizon) # 按時(shí)間順序切分 train_size int(0.7 * len(dataset)) val_size int(0.15 * len(dataset)) test_size len(dataset) - train_size - val_size train_data, val_data, test_data torch.utils.data.random_split( dataset, [train_size, val_size, test_size], generatortorch.Generator().manual_seed(42) )這里要特別提醒random_split會(huì)在內(nèi)部做隨機(jī)打亂但因?yàn)槲覀儤?gòu)造樣本時(shí)本身就是按時(shí)間順序滑動(dòng)窗口生成的可能不太合適。更穩(wěn)妥的做法是直接按索引切分不調(diào)用random_split具體看你自己需求。如果是嚴(yán)格的時(shí)序預(yù)測(cè)建議手動(dòng)切片保證訓(xùn)練集在時(shí)間上完全早于驗(yàn)證集和測(cè)試集。3.3 Transformer模型核心實(shí)現(xiàn)標(biāo)準(zhǔn)Transformer結(jié)構(gòu)里包含Encoder和Decoder。但時(shí)間序列預(yù)測(cè)不一定需要Decoder尤其是單步預(yù)測(cè)和直接多步預(yù)測(cè)用Encoder堆疊后接一個(gè)全連接輸出層就能取得不錯(cuò)的效果。我在實(shí)驗(yàn)中選的是Encoder-only方案結(jié)構(gòu)更輕訓(xùn)練更快。如果想做遞歸多步同樣可以復(fù)用這個(gè)Encoder只是在推理時(shí)多繞幾圈。下面是完整的模型定義位置編碼和Encoder主體都放進(jìn)去。import torch import torch.nn as nn import math class PositionalEncoding(nn.Module): def __init__(self, d_model, dropout0.1, max_len5000): super().__init__() self.dropout nn.Dropout(pdropout) pe torch.zeros(max_len, d_model) position torch.arange(0, max_len, dtypetorch.float).unsqueeze(1) div_term torch.exp(torch.arange(0, d_model, 2).float() * (-math.log(10000.0) / d_model)) pe[:, 0::2] torch.sin(position * div_term) pe[:, 1::2] torch.cos(position * div_term) pe pe.unsqueeze(0) self.register_buffer(pe, pe) def forward(self, x): x x self.pe[:, :x.size(1), :] return self.dropout(x) class TimeSeriesTransformer(nn.Module): def __init__(self, feature_dim1, d_model64, nhead4, num_layers2, dropout0.1): super().__init__() self.d_model d_model self.input_proj nn.Linear(feature_dim, d_model) self.pos_encoder PositionalEncoding(d_model, dropout) encoder_layer nn.TransformerEncoderLayer( d_modeld_model, nheadnhead, dim_feedforward256, dropoutdropout, batch_firstTrue, ) self.transformer_encoder nn.TransformerEncoder(encoder_layer, num_layersnum_layers) def forward(self, x): # x: [batch, seq_len, feature_dim] x self.input_proj(x) * math.sqrt(self.d_model) x self.pos_encoder(x) x self.transformer_encoder(x) return x在單步任務(wù)里輸出層可以只取編碼序列的最后一幀再接一個(gè)Linear。在多步任務(wù)里要么對(duì)最后一幀輸出horizon維要么把整個(gè)編碼序列壓平再接全連接。后者參數(shù)量大一般用前者class SingleStepHead(nn.Module): def __init__(self, d_model): super().__init__() self.fc nn.Linear(d_model, 1) def forward(self, enc_output): return self.fc(enc_output[:, -1, :]) # 取最后一個(gè)位置的編碼 class MultiStepHead(nn.Module): def __init__(self, d_model, horizon): super().__init__() self.fc nn.Linear(d_model, horizon) def forward(self, enc_output): return self.fc(enc_output[:, -1, :])為什么取“最后一個(gè)位置的編碼”而不是所有位置的編碼因?yàn)門ransformerEncoder每一層都會(huì)做全局注意力也就是說每個(gè)位置的輸出都已經(jīng)包含了對(duì)整個(gè)序列的“總結(jié)”。最后一個(gè)位置在時(shí)間上離預(yù)測(cè)目標(biāo)最近拿它做輸出頭的信息瓶頸最合適。如果要保留更多細(xì)節(jié)也可以把最后幾幀拼起來但代價(jià)是參數(shù)量增加收益不一定明顯。3.4 單步預(yù)測(cè)訓(xùn)練流程訓(xùn)練循環(huán)本身不復(fù)雜但有幾個(gè)地方我會(huì)特別注意。第一個(gè)是loss單步用MSE這是回歸任務(wù)的標(biāo)配。第二個(gè)是優(yōu)化器AdamW配合余弦退火幾乎是當(dāng)前Transformer訓(xùn)練的標(biāo)準(zhǔn)配置比單純用Adam穩(wěn)定。def train_model(model, train_loader, val_loader, epochs50, lr1e-3): device cuda if torch.cuda.is_available() else cpu model model.to(device) criterion nn.MSELoss() optimizer torch.optim.AdamW(model.parameters(), lrlr) scheduler torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_maxepochs) for epoch in range(epochs): model.train() train_loss 0.0 for x, y in train_loader: x, y x.to(device), y.to(device) optimizer.zero_grad() enc_out model(x) pred model.output_head(enc_out) loss criterion(pred, y) loss.backward() optimizer.step() train_loss loss.item() scheduler.step() val_loss evaluate(model, val_loader, criterion, device) if (epoch 1) % 10 0: print(fEpoch {epoch1}, Train Loss: {train_loss/len(train_loader):.6f}, Val Loss: {val_loss:.6f}) return model寫這段代碼時(shí)要注意model.output_head是我們?cè)谕獠繏焐先サ?。一個(gè)更方便的做法是在TimeSeriesTransformer里增加一個(gè)head_type參數(shù)直接在構(gòu)造函數(shù)里決定使用單步頭還是多步頭這樣訓(xùn)練代碼可以共用。訓(xùn)練時(shí)如果loss長(zhǎng)時(shí)間不下降先查兩件事學(xué)習(xí)率是不是太大數(shù)據(jù)有沒有標(biāo)準(zhǔn)化。絕大多數(shù)奇怪現(xiàn)象都出在這兩處。3.5 多步預(yù)測(cè)實(shí)現(xiàn)方式直接多步訓(xùn)練起來和單步幾乎一樣只是y的維度從1變成horizon輸出頭換成MultiStepHeadloss仍然用MSE。推理的時(shí)候一次拿到的就是未來horizon個(gè)點(diǎn)非常直接。遞歸多步需要額外寫一個(gè)推理函數(shù)把模型預(yù)測(cè)出的下一個(gè)值拼到輸入序列尾部同時(shí)丟掉最前面的點(diǎn)讓窗口“滑”起來。def recursive_forecast(model, history, steps, devicecpu): # history: [look_back, feature_dim] model.eval() history torch.tensor(history, dtypetorch.float32).unsqueeze(0).to(device) preds [] with torch.no_grad(): for _ in range(steps): enc_out model(history) pred model.output_head(enc_out) # [1, 1] preds.append(pred.item()) pred pred.unsqueeze(-1) # [1, 1, 1] history torch.cat([history[:, 1:, :], pred], dim1) return preds這個(gè)思路很直觀但坑也在這輸入用的預(yù)測(cè)值本身就是不準(zhǔn)的誤差會(huì)隨著步數(shù)增多不斷放大。我實(shí)測(cè)下來horizon6時(shí)還能看horizon24時(shí)后面基本變成一條平滑直線。緩解誤差累積有幾個(gè)實(shí)用技巧訓(xùn)練時(shí)用Teacher Forcing即以一定概率用真實(shí)值替代預(yù)測(cè)值去喂下一步讓模型適應(yīng)自己的預(yù)測(cè)對(duì)輸出做clip限制預(yù)測(cè)值的合理范圍避免極端值把窗口帶偏推理階段用確定性策略比如取中位數(shù)而不是單次路徑。3.6 評(píng)估與可視化評(píng)估指標(biāo)我用三個(gè)MAE、RMSE和R2。MAE好解釋RMSE對(duì)大誤差更敏感R2則能反應(yīng)模型對(duì)真實(shí)趨勢(shì)的擬合程度。from sklearn.metrics import mean_absolute_error, mean_squared_error, r2_score def evaluate_metrics(y_true, y_pred): mae mean_absolute_error(y_true, y_pred) rmse mean_squared_error(y_true, y_pred, squaredFalse) r2 r2_score(y_true, y_pred) return {MAE: mae, RMSE: rmse, R2: r2}畫圖建議用matplotlib把測(cè)試集真實(shí)值和預(yù)測(cè)值畫在同一張圖里。多步預(yù)測(cè)時(shí)我會(huì)把每個(gè)預(yù)測(cè)窗口的起點(diǎn)和終點(diǎn)連起來畫成階梯狀能更清楚地看到誤差累積發(fā)生在哪個(gè)階段。import matplotlib.pyplot as plt plt.figure(figsize(12, 5)) plt.plot(y_true, labelTrue) plt.plot(y_pred, labelPred) plt.legend() plt.title(Time Series Prediction) plt.show()這張圖是判斷模型有沒有“學(xué)到東西”的最快方式。如果pred和true的相位都對(duì)不上先檢查窗口長(zhǎng)度是否合理如果趨勢(shì)對(duì)但局部抖動(dòng)不對(duì)考慮加更多特征或調(diào)d_model。4. 常見問題與排查技巧實(shí)錄4.1 數(shù)據(jù)泄漏最隱蔽也最致命數(shù)據(jù)泄漏是時(shí)間序列預(yù)測(cè)里出現(xiàn)頻率最高的“幽靈問題”。除了歸一化泄漏還有一種是數(shù)據(jù)集劃分時(shí)不注意時(shí)間順序把未來樣本混進(jìn)訓(xùn)練集結(jié)果模型在測(cè)試集上表現(xiàn)“超神”一到線上就崩。處理辦法是嚴(yán)格按時(shí)間順序劃分且在構(gòu)造滑動(dòng)窗口時(shí)讓訓(xùn)練集只使用該時(shí)間點(diǎn)之前的數(shù)據(jù)。另外如果數(shù)據(jù)來自多個(gè)實(shí)體比如多個(gè)城市或設(shè)備的序列不能把它們混在一起打亂劃分應(yīng)該按實(shí)體分組切分否則也會(huì)出現(xiàn)實(shí)體級(jí)別的泄漏。我自己的判斷標(biāo)準(zhǔn)很簡(jiǎn)單如果訓(xùn)練集和測(cè)試集的MAE差距小得離譜或者測(cè)試集比訓(xùn)練集還好那大概率是泄漏了。正常情況訓(xùn)練誤差應(yīng)該略低于測(cè)試誤差這個(gè)經(jīng)驗(yàn)雖然不絕對(duì)但能幫你快速發(fā)現(xiàn)問題。4.2 訓(xùn)練Loss不降或變成NaN我遇到過一次Loss變成NaN的情況查了半天發(fā)現(xiàn)是沒有對(duì)輸入數(shù)據(jù)做歸一化數(shù)值稍微大一點(diǎn)經(jīng)過多頭注意力里的softmax后就爆炸了。解決方法是先把數(shù)據(jù)縮放到[0, 1]或標(biāo)準(zhǔn)化到均值0方差1再開始訓(xùn)練。如果標(biāo)準(zhǔn)化后還是NaN檢查一下學(xué)習(xí)率Transformer的訓(xùn)練不太吃固定的大學(xué)習(xí)率建議從1e-4或者3e-4開始試。還有一種可能是位置編碼的max_len不夠序列長(zhǎng)度超過上限導(dǎo)致pe切片出問題這種一般會(huì)直接報(bào)IndexError不太會(huì)靜默NaN。另外一個(gè)容易忽視的點(diǎn)是batch_first。Pytorch的TransformerEncoderLayer默認(rèn)batch_firstFalse如果輸入維度是[batch, seq_len, feature]必須顯式設(shè)置batch_firstTrue否則會(huì)對(duì)seq_len維度做batch維處理雖然不報(bào)錯(cuò)但結(jié)果完全不對(duì)。這種錯(cuò)誤很難排查因?yàn)樗憩F(xiàn)成loss一直在下降但驗(yàn)證曲線不對(duì)勁。4.3 多步預(yù)測(cè)后期曲線“平”了多步預(yù)測(cè)的誤差累積問題前面提過這是所有遞歸式預(yù)測(cè)的通病。處理思路有兩個(gè)方向一是把模型換成直接多步輸出一次性預(yù)測(cè)完整未來區(qū)間從根源上避免遞歸累積二是引入機(jī)器學(xué)習(xí)里的魯棒性技巧比如訓(xùn)練時(shí)對(duì)輸入加小噪聲、預(yù)測(cè)時(shí)對(duì)輸出做平滑。我自己的經(jīng)驗(yàn)是如果horizon不超過10遞歸多步能省顯存且效果不差如果horizon到了24以上直接多步會(huì)更穩(wěn)定。建議在實(shí)驗(yàn)設(shè)置里同時(shí)保留這兩種模式用驗(yàn)證集決定到底用哪個(gè)。有時(shí)“曲線平了”也不全是誤差累積的問題可能是數(shù)據(jù)本身的信噪比太低。我畫過頻譜圖之后發(fā)現(xiàn)數(shù)據(jù)里真正可預(yù)測(cè)的成分只占很小一部分模型很容易傾向于輸出均值附近的值。這時(shí)候考慮對(duì)數(shù)據(jù)做差分或季節(jié)分解把趨勢(shì)和周期拆開建模再對(duì)殘差做預(yù)測(cè)。4.4 顯存和訓(xùn)練速度問題注意力矩陣的大小是平方級(jí)增長(zhǎng)的窗口長(zhǎng)度從24改成96顯存占用可能直接翻好幾倍。如果顯存不夠優(yōu)先調(diào)小batch_size或者用梯度累積gradient accumulation模擬更大的batch。Pytorch的自動(dòng)混合精度AMP也值得開torch.cuda.amp里封裝得已經(jīng)很成熟能省不少顯存還能加速訓(xùn)練。下面是一個(gè)簡(jiǎn)化的混合精度訓(xùn)練片段scaler torch.cuda.amp.GradScaler() for x, y in train_loader: optimizer.zero_grad() with torch.cuda.amp.autocast(): pred model(x) loss criterion(pred, y) scaler.scale(loss).backward() scaler.step(optimizer) scaler.update()AMP在NVIDIA GPU上用Pytorch 2.x已經(jīng)非常穩(wěn)定CPU上不用開。還有一個(gè)建議盡量用batch_firstTrue的TransformerEncoderLayerPytorch默認(rèn)是False如果搞錯(cuò)了維度雖然報(bào)錯(cuò)你會(huì)知道但排查起來很煩。4.5 長(zhǎng)序列窗口的改進(jìn)空間標(biāo)準(zhǔn)Transformer處理幾百甚至上千的時(shí)間步時(shí)顯存和效率都會(huì)遇到瓶頸。我這次實(shí)驗(yàn)主要用的是中等長(zhǎng)度窗口但如果你遇到超長(zhǎng)序列建議看看Transformer的改進(jìn)變體比如Informer的稀疏注意力、Autoformer的分解機(jī)制、PatchTST把時(shí)間序列切成patch再編碼。這些都在標(biāo)準(zhǔn)Transformer的思路上做了針對(duì)性優(yōu)化很適合高頻金融數(shù)據(jù)、長(zhǎng)時(shí)間傳感器監(jiān)測(cè)這類場(chǎng)景。我后續(xù)也在計(jì)劃把PatchTST并進(jìn)這套實(shí)驗(yàn)框架里做對(duì)比。另外提醒一句模型調(diào)參不是全部。數(shù)據(jù)質(zhì)量、特征工程、異常值處理對(duì)最終預(yù)測(cè)效果的影響往往比換模型更明顯。我在做這套實(shí)驗(yàn)時(shí)花了將近一半時(shí)間在清洗和構(gòu)建特征上模型本身雖然重要但絕不是唯一變量。做完整套單步、多步實(shí)驗(yàn)后我最深的體會(huì)是Transformer不是一個(gè)“萬能開關(guān)”它適合的是長(zhǎng)依賴和多變量交互明顯的時(shí)間序列。在這套實(shí)驗(yàn)中我用Pytorch從數(shù)據(jù)預(yù)處理、模型搭建到評(píng)估可視化完整走了一遍也踩了不少坑。如果你正打算在自己的數(shù)據(jù)上復(fù)現(xiàn)建議先把數(shù)據(jù)好好看一眼再按文中的代碼結(jié)構(gòu)一點(diǎn)點(diǎn)搭別急著直接套大模型。先把單步跑通再多步最后再回頭調(diào)超參這樣每一步都能定位到問題。希望這篇記錄能幫你少走點(diǎn)彎路。本文還有配套的精品資源點(diǎn)擊獲取