# Phate Weekly Sync 彙整

> 彙整範圍：2026-04-01 至 2026-07-10，來源包含每週 `index.md`、`teamkube.md` 與目前的 `20260` 草稿。

## 執行摘要

工作可歸納為五條主軸：Gemma 4 評估與選型、Agent/API 相容性、推論部署與監控、BU 技術支援，以及資安維運與資料分析。4 月先建立部署與用量基礎，5 月集中排查模型及 Agent 相容性，6 月完成量化模型評估，7 月則進入服務升級、稽核改善與使用紀錄分析。

### 主要成果

- 建立 `llm-acceptance-test`，完成 42 個 Gemma 4 量化模型的中文、推理品質與吞吐量評估。
- 完成 GPU Server 26B vLLM QAT 與 31B + MTP 升級，並建立 Grafana／vLLM 監控。
- 定位 TAIDE `tie_word_embeddings` 與 GPT OSS／GB10 SM121 推論異常。
- 建立每月 BU 用量報表排程，完成 2026 內稽、MinIO 紀錄遷移與 Langfuse 升級。

## 跨週主軸

### 1. Gemma 4 評估與選型

- 涵蓋 E4B、12B、26B A4B、31B，以及 QAT、Q4、FP8、NVFP4、W4A16 等格式。
- TMMLU+ 公文 one-shot 平均：vLLM 57.88%、llama.cpp 54.73%；12B、31B 較穩定，26B GGUF 中文表現明顯偏低。
- logic reasoning 中 26B FP8 Dynamic／NVFP4／QAT 分別為 76.98%／74.82%／69.06%；FP8 相較 Q4_K_M、NVFP4 約高 5%。
- 12B、31B 平均約 1,300～1,600 tokens；部分 12B、26B 執行達 6,000～7,000 tokens，成本差異顯著；單顆 A100 上 31B 最快完成。
- 建議 26B 採 vLLM QAT；記憶體足夠時 12B 採 FP16 + MTP；31B 採 llama.cpp QAT + MTP，但 24 GB 僅餘 64K context 且不支援 multimodal projector。

### 2. Agent 與 API 相容性

- vLLM、llama.cpp、LiteLLM 對 OpenAI Responses、Anthropic Messages、串流 function calling 與多輪工具呼叫支援不完整。
- 驗證由 API 規格檢查改為 Pi Agent + Terminal Bench 2.1；Gemma 4 開啟推理後通過案例增加，但 timeout 也上升。
- GTX 1060 上 26B 約 10 tok/s，多數任務超時，測試改移至 GCP L4；執行紀錄仍需導入 pipeline／實驗追蹤。

### 3. 推論效能、部署與監控

- 單張 L4 24 GB 可部署 26B A4B NVFP4；31B 的 vLLM KV Cache 不足，llama.cpp QAT + MTP 約 35 tok/s。
- 6000 Ada 單請求輸出：E4B 125.02、12B NVFP4 70.81、12B FP16 + MTP 81.02、26B NVFP4 148.84 tok/s；12B MTP draft 接受率約七成。
- Gemma 4 MoE 尚不支援 vLLM data parallelism；Caddy 與 LiteLLM 負載均衡差異不大。
- 已建立 Grafana／vLLM 儀表板；曾因 GPU driver 自動更新造成舊 DCGM 容器重啟與 CPU 占用，已移除並規劃升級。
- 每月 1 日自動產出各 API key 的 JSON／Markdown／HTML 用量報表；持續整理 OpenSearch 與 GPU 部署矩陣。

### 4. BU 支援與模型問題排查

- TAIDE GPT OSS 因 `tie_word_embeddings`、tokenizer 與 Harmony token 問題無法穩定輸出；覆蓋設定後可生成，已回報團隊。
- GPT OSS 在 GB10 受 SM121 backend 支援不完整影響；已提供指定 `CUDA_DOCKER_ARCH=121` 的 llama.cpp image，並調整 temperature／response format 建議。
- FPS 因 MLPub timeout 改在 TWCC 建立獨立環境與網域；另協助 AISBU 比較 Llama 3.1 在 GTX 1060 與 GCP L4 的效能。
- 部署 CPU 版 OpenAI Privacy Filter 供 BU 測試；協助 chatbot 弱掃修正與 rasa_nlp／DeepPavlov 版本固定。
- TFDA 知識圖譜半年 PoC 初步建議評估 PostgreSQL-based Apache AGE，降低 JanusGraph 導入時程風險。

### 5. 維運、稽核與資料分析

- 完成 7/8 內稽；Notion 備份檢查、資產拆分與筆電公發等改善事項已建立 Jira：`GSSQA-9036`、`GSSQA-9041`、`GSSQA-9053`。
- MinIO 事件紀錄約 1.2 TB（2026 年 280 萬筆）；已備份 2026 H2 前請求、分批刪除舊資料並將新紀錄移至 HDD。
- 367 萬筆聊天紀錄去重為 161 萬筆 prompt，經 Nomic v2、UMAP、HDBSCAN、c-TF-IDF 與 LLM labeling 形成 4,359 個主題。
- Git workflow 已整理為簡報，後續提供共用自動化腳本。

## 逐週摘要

| 週次 | 重點 | 產出／結論 | 後續 |
| --- | --- | --- | --- |
| 04/23 | Gemma 4 壓測、AI IDE | 26B 可在 L4 部署；31B KV Cache 不足；建立 Agent 驗證流程 | 測試 L40S／A100 與 GPU 互連 |
| 04/30 | GPU Server、AI 開發工具 | GB10 部署 Ollama；確認多輪 function call 與 LiteLLM 相容性問題 | Ollama API 先不經 LiteLLM；增加 Claude SDK 測試 |
| 05/07 | Coding Agent、監控、Gemma 4 | Claude Code 直連 Ollama 仍不穩；建立 vLLM 儀表板 | 測試其他開源 Agent 與 BU GPU |
| 05/21 | GPT OSS、資安、Git workflow | 找出 GB10 推論異常原因並提供 Docker image；送出風險評鑑 | 帳號清查、雲端服務評估、弱掃報告與共用腳本 |
| 05/28 | Agent 相容性測試 | 驗證策略改為 Pi Agent + Terminal Bench 2.1 | 移至 GCP L4，改善執行紀錄管理 |
| 06/04 | TAIDE、Terminal Bench | 找出 `tie_word_embeddings` 問題；Gemma 4 推理模式提高通過案例 | 驗證 GGUF tokenizer 與處理超時 |
| 06/11 | Gemma 4 評估流程 | 確定模型矩陣與 TMMLU+／function call 資料；更新 acceptance test | 執行不同量化格式與框架比較 |
| 06/18 | 中文能力與吞吐量 | 完成 42 個模型評估；比較模型規模、few-shot、token 與 6000 Ada 效能 | 補測 BitsAndBytes、FP8；討論結果展示 |
| 06/25 | logic reasoning 與推理品質 | 26B FP8 Dynamic 正確率最高；完成 556 筆推理品質分類 | 26B 切 vLLM QAT；31B 加 MTP；12B 建議 FP16 + MTP |
| 07/02 | GPU Server 升級與監控 | 26B 服務升級、31B + MTP 上線，持續觀察 vLLM 指標 | 內部稽核、Mend 遷移、OpenSearch 文件 |
| 07/09 | 稽核、儲存空間、聊天紀錄分析 | 完成內部稽核；清理 MinIO；完成 161 萬筆 prompt 的主題分析 | 修正稽核事項並深化主題／使用行為分析 |
| 目前草稿 | Gemma 4 logic reasoning | 補充 26B 量化比較與 GPT-5.4 推理品質評估 | 延續服務版本調整與 BU 選型建議 |

## 目前狀態

### 已完成

- Gemma 4 主要版本的中文、推理品質與吞吐量初步評估。
- GPU Server 26B 與 31B 服務版本調整。
- TAIDE 與 GPT OSS 主要異常原因定位及 BU 回覆。
- 2026 內部稽核、MinIO 空間清理與 Langfuse 升級。
- 大規模聊天紀錄去重、向量化、分群與主題標記流程。
- BU 月用量報表、Privacy Filter 服務與 FPS TWCC 獨立環境。

### 進行中

- vLLM prefix cache、MTP 與服務穩定性觀察。
- Coding Agent 在不同模型與 provider 上的 Terminal Bench 驗證。
- BitsAndBytes、FP8 與更多 GPU 環境的補充測試。
- 三項內稽 Jira 改善、OpenSearch 部署文件與 Mend 遷移。
- 聊天紀錄主題結果的整理與展示。
- TFDA 知識圖譜 PoC 技術選型。

### 主要風險與待決事項

- 推論框架對新模型、GPU 架構與 API 相容層的支援速度不一致。
- 31B 模型部署受 KV Cache 與 GPU 記憶體限制，需持續調整共置與 MTP 策略。
- Coding Agent 評估容易受模型輸出長度、推理模式與 timeout 影響，需建立一致的成功條件與紀錄格式。
- Notion 方案缺乏稽核紀錄，備份驗證流程仍需制度化。