計原理:windowTokens 與 decodeWindow 如何避免虛假 tok/s)
dsh-our-free-model 速度統(tǒng)計原理windowTokens 與 decodeWindow 如何避免虛假 tok/s【免費下載鏈接】dsh-our-free-model在 dsh 里裝上這個插件即可無需登錄、注冊或填 API Key就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在內(nèi)的前沿模型——完全免費不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.項目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-modeldsh-our-free-model 是 dsh 里的免費大模型插件裝上即用無需登錄、注冊或 API KeyDeepSeek V4.1 Flash、Kimi K3 等前沿模型開箱可用且不限流量。它的設(shè)置頁還有一塊速度統(tǒng)計看板但 tok/s 這個數(shù)字很容易造假——早期版本曾給一條實際約 40 tok/s 的車道報告出 2 941 tok/s。本文帶你徹底搞懂 windowTokens 與 decodeWindow 兩個函數(shù)如何聯(lián)手守住這個數(shù)字的誠實底線。虛假速度的兩個真實案例 問題出在分子和分母度量的不是同一段時間。團隊用真實流量抓到了兩個典型案例一看不見的 reasoning token 撐大了分子。一次調(diào)用計費 422 個輸出 token其中 291 個是 reasoning token——但一個推理幀都沒流出。這些 token 在第一個可見 token 之前就已生成完畢若全算進分子除以答案文本落地的 1.2 秒就發(fā)布出 349 tok/s而答案實際只有 108 tok/s。案例二1 毫秒的解碼窗口。一次真實記錄在首 token 等待 2 977 ms 之后63 個輸出 token 在 1 ms 內(nèi)解碼完畢直接算出 63 000 tok/s這一個點就把 26 次調(diào)用的均值抬高到 2 493 tok/s——而該車道真實水平約 40 tok/s。直連讀包的探針scripts/probes/decode-window.mjs證實網(wǎng)關(guān)并非批量投遞64 個幀均勻分布在 5.6 秒里。所以鍋不在網(wǎng)關(guān)而在算法。第一道防線windowTokens 剔除沒流出的 tokenwindowTokens() 回答一個問題哪些輸出 token 可以被誠實地除以實測窗口規(guī)則只有兩條如果推理內(nèi)容確實逐幀流出sawReasoning為真窗口覆蓋了推理階段全部輸出 token 計入分子如果推理沒有流出任何幀就把reasoningTokens從分子中扣掉——它們在窗口起點之前就已生成完畢算進解碼速度屬于張冠李戴。對應(yīng)到案例一422 ? 291 131 個 token除以 1.2 秒得到的才是真實的 108 tok/s。第二道防線decodeWindow 的兩條硬邊界分子修正后decodeWindow() 再守住分母側(cè)。兩個常量寫得很直白MIN_DECODE_MS 250、MAX_CREDIBLE_TPS 250。判定邏輯分四步調(diào)用失敗、分子為 0、或窗口短于 250 ms——這根本不是一個測量直接丟棄算出的速率超過 250 tok/s——幀必然被合并投遞了不是真速度同樣丟棄結(jié)果非有限數(shù)值丟棄通過檢驗才返回可測量的 tps。該車道實測的持續(xù)輸出速度是幾十 tok/s所以 250 tok/s 的上限遠在任何真實值之外被丟棄的調(diào)用不會被平均進統(tǒng)計而是不參與求和。看板如何匯總Σtoken / Σ秒而非速率平均recordUsage() 把每次完成的調(diào)用累加進按天、按模型的桶里速度圖表取的是Σtoken ÷ Σ秒的總量比值而不是對各次調(diào)用的 tok/s 取平均——正是后者曾被那個 1 ms 窗口抬高三個數(shù)量級。不可測量的調(diào)用其窗口時間和 token 都不進總和。這也是為什么看板上某些模型的速度欄顯示—答案集中在一兩個大幀里落地的模型不具備可測量的輸出速度誠實地留白好過編一個數(shù)字。相關(guān)決策記錄見 README 的為什么速度那一欄會顯示 — 一節(jié)。一鍵驗證本地跑通速度統(tǒng)計測試 兩條命令即可親眼看規(guī)則生效node scripts/speed-stat-test.mjs——speed-stat-test.mjs 逐條斷言未流出的 reasoning 必須離開分子、1 ms 窗口不算測量、561 tok/s 判定為幀合并、任何一次調(diào)用都不得被平均成虛假的 tok/snode scripts/probes/decode-window.mjs——decode-window.mjs 實時調(diào)用兩個免費模型逐幀打印到達時間與負載把插件報告的速率和全部輸出 token 的速率并排對照一目了然。核心實現(xiàn)分布在 src/stream.js流解析與windowTokens與 src/store.js窗口判定與統(tǒng)計累加配合 src/adapter.js 中首次 delta 的時間戳打點構(gòu)成完整鏈路。小結(jié)防線函數(shù)防住的騙局分子windowTokens()未流出的 reasoning token 虛增速度分母decodeWindow()過短窗口與幀合并導(dǎo)致的超光速匯總recordUsage()單點極值污染整體均值速度統(tǒng)計的意義不在于炫耀 tok/s而在于讓數(shù)字配得上免費不限量的免費大模型插件這一體驗?zāi)憧吹?40 tok/s它就該是 40 tok/s?!久赓M下載鏈接】dsh-our-free-model在 dsh 里裝上這個插件即可無需登錄、注冊或填 API Key就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在內(nèi)的前沿模型——完全免費不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.項目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-model創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考