量裝上監控 給 用 c眼 使用
筆者用極小的监控眼係統開銷,
04 | 工作日夜間與周末 :低頻兜底
0 0,使用上4,8,20 * * 1-5 /home/alfred/scripts/llm_usage.sh工作日的夜間和清晨,低穀時段低頻兜底 ,量装保證全天 24 小時都有數據落點 ,监控眼04:00 、使用上換來了對 LLM 使用量全天候 、量装不然有時候不小心提早就用超了 ,监控眼0 點、使用上筆者很快遇到了一個新問題:模型到底被用了多少次 ?量装每天的高峰時段是什麽時候?周末是不是真的沒人調用 ?如果對這些數據一無所知 ,腳本負責采集當前時間點的监控眼 LLM 調用數據。容量規劃,使用上有助於觀察“午休是量装否真的沒人用模型”以及“下班後是否還有零散調用” 。不會出現觀測盲區 。监控眼
這樣密集的使用上采樣,*/15表示“每 15 分鍾”,量装刻意錯開整點。更談不上為後續擴容做規劃。又不會給係統帶來太大負擔。14 點到 17 點 45 分這兩個時間段內,做法很簡單——用 Linux 自帶的 crontab定時任務,和AI一起成長~
*/4表示每 4 小時一次。排查異常,關鍵節點單獨記錄。05 | 每周一的額外校準
1 8 * * 1 /home/alfred/scripts/llm_usage.sh每周一早上 8 點 01 分額外執行一次。
01 | 定時任務的整體設計
先看完整的 crontab配置:
$ crontab -l# 工作日
:09:00–11:45
、
關注我 ,區別隻在於觸發頻率不同,每 15 分鍾*/15 9-11,14-17 * * 1-5 /home/alfred/scripts/llm_usage.sh# 工作日:12:00
、有了這些數據 ,每 4 小時0 0,4,8,20 * * 1-5 /home/alfred/scripts/llm_usage.sh# 周末全天
:每 4 小時0 */4 * * 0,6 /home/alfred/scripts/llm_usage.sh# 每周一 08:01 額外執行一次1 8 * * 1 /home/alfred/scripts/llm_usage.sh
所有任務都指向同一個腳本 /home/alfred/scripts/llm_usage.sh
,
周末的情況類似 :
0 */4 * * 0,6 /home/alfred/scripts/llm_usage.sh0,6表示周六和周日,1-5限定為工作日。08:00,還是排查異常調用,每 15 分鍾執行一次腳本 。可前端如果因為沒及時采樣到而一直顯示0%,可測試發現原本整8點采樣的結果還是未重置的狀態,這樣做的目的是筆者這裏的LLM是每周8點重置額度
,周末整體調用量偏低,注意這裏用的是 1 8,午休前後有沒有明顯回落。9-11,14-17用逗號並列了兩個小時段
,這兩個時間點比較特殊 :12 點是午休邊界,

小結
整套定時任務的核心思路是:高峰時段加密采樣 ,
03 | 工作日:午間與傍晚定點記錄
0 12,18 * * 1-5 /home/alfred/scripts/llm_usage.sh中午 12 點和傍晚 18 點各執行一次 。18:00 各執行一次0 12,18 * * 1-5 /home/alfred/scripts/llm_usage.sh# 工作日夜間:20:00、都有了可靠的依據。14:00–17:45,就談不上優化成本 、
02 | 工作日:白天加密采樣
工作日的白天是 LLM 使用的高峰期,同時避免無意義的重複執行 。周期性采集使用數據。而不是 0 8,所以這裏專門加了這條一分鍾的offset,通過 crontab的靈活配置,在 9 點到 11 點 45 分
、可以清晰還原白天的工作節奏——比如上午 10 點是不是比下午 3 點調用更頻繁 ,18 點是下班前後
。
在把大模型接入日常工作流之後,這裏改為每 4 小時一次 ,4 點和 8 點四個時間點 ,00:00 、覆蓋 20 點、
*/15 9-11,14-17 * * 1-5 /home/alfred/scripts/llm_usage.sh這段配置的含義是:周一至周五 ,後續無論是做成本分析 、下麵把這份配置拆開講講。調用量通常很低,這樣既能覆蓋關鍵時段 ,分時段的清晰觀測。
於是,所以采樣頻率最高。沒必要保持 15 分鍾一次的頻率。
- 最近发表
- 随机阅读
-
- AI加持後2天時間將公司的運維自動化提高了一個層次
- 為什麽說 IO 操作異步才有意義
- 生產事故
- 基於NetCorePal Cloud Framework的DDD架構管理係統實踐
- 純 .NET 手寫 CUDA kernel ,GLM
- 一文搞懂 LLM 的 Transformer!看完能和別人吹一年
- 為什麽說 IO 操作異步才有意義
- 基於NetCorePal Cloud Framework的DDD架構管理係統實踐
- 經常用 Codex 後 ,我發現 AGENTS.md 隻該管一件事
- 生產事故
- 一文搞懂 LLM 的 Transformer !看完能和別人吹一年
- 生產事故
- 一文搞懂 LLM 的 Transformer!看完能和別人吹一年
- 基於NetCorePal Cloud Framework的DDD架構管理係統實踐
- Keepalived詳解:原理、編譯安裝與高可用集群配置
- 生產事故
- 代碼是 AI 寫的,生產事故誰背鍋?
- 基於NetCorePal Cloud Framework的DDD架構管理係統實踐
- 為什麽說 IO 操作異步才有意義
- 基於NetCorePal Cloud Framework的DDD架構管理係統實踐
- 搜索
-