
TraceLLM
TraceLLM 是一個本地優先的 LLM 可觀察性平台,它追蹤 AI 工作流程中的會話、跨度、提示/輸出(可選)、代幣、延遲和錯誤,並具有策略控制和 OpenTelemetry (OTLP) 導出支持。
https://tracellm.in/?ref=producthunt&utm_source=aipure

產品資訊
更新時間:2026年08月07日
什麼是 TraceLLM
TraceLLM 是一個用於生產 LLM 應用程式的可觀察性和調試產品,它將模型調用和周圍的應用程式活動整合到一個單一的、可查詢的追蹤中。它專為現代 AI 系統設計——聊天機器人、代理工作流程和 RAG 服務——在這些系統中,單個用戶請求可以觸發多個模型調用、工具調用和中間步驟,這些步驟事後很難檢查。TraceLLM 提供「每個 AI 工作流程一個時間線」的體驗,捕獲關鍵操作信號(延遲、代幣使用量、錯誤、元數據),並在啟用時捕獲提示和模型輸出,以便團隊可以準確了解問題運行期間發生了什麼。
TraceLLM 的主要功能
TraceLLM 是一款 LLM 可觀察性和追蹤產品,可將端到端 AI 工作流程執行擷取為單一、可查詢的時間軸,涵蓋會話、跨度、生命週期事件、Token 使用量、延遲、提供者/模型呼叫和錯誤,並具有可配置的擷取/編輯策略以及可選的 OpenTelemetry (OTLP) 匯出到現有監控堆疊(例如 SigNoz)。它旨在透過保留調查錯誤答案、效能退化、Token 峰值以及跨提供者和框架的故障所需的上下文,使多步驟 LLM 應用程式(聊天機器人、代理、RAG、工具使用工作流程、路由器/閘道)可偵錯。
會話 + 跨度時間軸(「一個追蹤,一個故事」): 將每個 AI 工作流程記錄為一個統一的追蹤,包含會話、跨度事件,因此您可以準確地看到從請求開始到模型完成所發生的一切,而無需拼接供應商儀表板和分散的日誌。
使用量、延遲和錯誤可觀察性: 擷取 Token 計數、時間/延遲、請求狀態以及附加到相同追蹤的異常,以快速診斷生產中的瓶頸、成本峰值和故障模式。
帶有策略控制的提示/輸出擷取: 支援可選的提示和模型輸出擷取,由專案級控制(擷取開/關、僅中繼資料模式、編輯、採樣)管理,以平衡偵錯價值與隱私/合規性需求。
嵌入式 SDK 檢測 (Node): 提供輕量級 SDK,無需更改請求執行位置即可包裝實際模型呼叫,支援常見的 LLM 應用程式模式,例如代理、RAG、工具和閘道。
與提供者和框架無關的工作流程追蹤: 旨在跨異構堆疊和模型提供者(例如,提及 OpenAI/Claude/Gemini 模式)進行追蹤,即使團隊使用多個模型和運行時,也能實現統一的操作視圖。
OpenTelemetry (OTLP) 匯出管道: 透過 OTLP(例如 SigNoz)將相同的產品級追蹤匯出到外部可觀察性系統,讓團隊將 LLM 工作流程遙測整合到現有的監控和警報管道中。
TraceLLM 的使用案例
客戶支援聊天機器人偵錯: 當使用者報告錯誤或不安全的答案時,工程師可以開啟確切的會話,檢查模型跨度(提供者/模型/Token/延遲),並審查周圍事件以查明基礎/檢索/工具問題。
代理工作流程可靠性(工具 + 多步驟規劃): 追蹤模型呼叫和工具調用的鏈條,以便團隊可以識別代理在哪裡循環、選擇了錯誤的工具、靜默失敗,或者儘管延遲/Token「健康」卻產生了自信的錯誤回應。
RAG 品質和基礎調查: 透過將檢索/工具事件與最終回應相關聯,幫助診斷檢索-答案失敗,使其更容易查看是否擷取了正確的上下文以及它如何影響輸出。
生產 AI 的成本和效能最佳化: 使用每個跨度的 Token 使用量和延遲來查找昂貴的提示、退化和熱點,從而在成本或尾部延遲影響使用者之前實現有針對性的提示/路由/模型更改。
多提供者模型路由和 A/B 操作: 在使用多個提供者/模型的環境中,TraceLLM 提供跨路由的單一行為視圖,使其更容易比較部署之間的可靠性、成本和延遲。
優點
跨模型呼叫、應用程式事件、使用量和錯誤的統一追蹤時間軸——減少了關聯不同日誌和供應商儀表板所花費的時間。
策略驅動的擷取(採樣/編輯/僅中繼資料)加上 OTLP 匯出支援隱私需求以及與現有可觀察性堆疊的整合。
專為真實世界的 LLM 應用程式模式(代理、RAG、工具、閘道)和多提供者設定而設計。
缺點
如果策略配置錯誤,擷取提示/輸出可能會引入隱私/合規風險;需要仔細編輯和採樣。
提供的來源中顯示的 SDK 覆蓋範圍主要是 Node;其他運行時的團隊可能需要額外的支援或自訂檢測。
可觀察性會增加操作開銷(檢測、儲存和審查工作流程),尤其是在高追蹤量下。
如何使用 TraceLLM
1) 選擇您所指的「TraceLLM」(可觀察性與研究框架): 「TraceLLM」這個名稱在來源中被多個項目使用:(A) TraceLLM 可觀察性產品 (tracellm.in),用於追蹤提示/跨度/代幣/錯誤並透過 OTLP 導出;(B) 基於 MCP 伺服器的記錄器,公開 log_action/get_logs/get_summary 等工具;(C) 名為 TraceLLM 的研究代碼庫(例如,微服務追蹤生成;需求可追溯性)。以下步驟重點介紹 TraceLLM 可觀察性產品,因為它在來源中提供了終端用戶「如何使用」文檔和 SDK 片段。
2) 創建一個 TraceLLM 項目並獲取 API 金鑰: 在 TraceLLM 網路應用程式中(從 tracellm.in/app 連結),創建一個項目。複製項目 API 金鑰(顯示為 trllm_live_••••••••••••••)。該金鑰控制所有權以及 SDK 行為,例如捕獲策略、編輯和取樣。
3) 安裝 Node SDK: 按照網站上的說明將 SDK 添加到您的 Node 項目中:`pnpm add @use-tracellm/sdk-node`。
4) 使用 TraceLLM 跨度包裝實際模型調用(直接追蹤): 使用 SDK 在您的實際提供商調用周圍創建一個跨度,而無需更改請求的運行位置。網站上的示例模式:在執行 LLM 請求的代碼周圍使用 `trace.span({ provider: "openai", model: "gpt-4.1-mini" })`。這會捕獲一個包含跨度、生命週期事件、延遲和代幣使用量(當 OpenAI 相容響應可用時)的單個工作流程記錄。
5) 捕獲完整的工作流程上下文(會話、跨度、事件、錯誤、代幣、元數據): 組織追蹤,使一個用戶工作流程成為一個調試記錄:使用會話名稱(例如,chatbot.request),然後記錄模型跨度(例如,openai.chat.complete),並添加生命週期事件(provider.request.started、provider.response、工具/檢索事件)。確保錯誤記錄在相同的追蹤上,以便故障仍然附加到會話時間線。
6) 在執行期間添加自定義屬性和事件(可選): 如果您的 SDK 支持活動跨度訪問(如來源所示),請添加運行時屬性和事件:獲取活動跨度,設置 `custom.metric` 等屬性,並添加 `cache_hit` 等事件,其中包含結構化字段(例如,`{ key: "user_context" }`)。這有助於將應用程式級別的信號與模型行為相關聯。
7) 使用嵌套跨度追蹤多步驟工作流程(鏈): 對於代理/RAG/工具管道,創建一個父工作流程跨度(一個「鏈」),並為 LLM 調用、檢索和工具嵌套子跨度。來源顯示了一種模式,其中嵌套跨度自動成為父跨度的子跨度,為整個工作流程生成一個連貫的時間線。
8) 配置捕獲策略、編輯和取樣: 在 TraceLLM UI 中(或透過與 API 金鑰綁定的項目設置),配置要捕獲的內容:內容捕獲開/關、元數據開/關、編輯開和取樣(顯示示例:70%)。這控制是否存儲提示/輸出以及如何處理敏感數據。
9) 在追蹤瀏覽器中查看追蹤(會話和實時追蹤): 打開 TraceLLM 應用程式,並使用會話/實時追蹤按會話名稱、狀態(正常/錯誤)或時間戳查找工作流程。檢查模型跨度以查看提供商/模型、延遲、代幣使用量和請求狀態。查看事件時間線和任何附加錯誤。
10) 使用 TraceLLM 調試報告的錯誤答案(推薦工作流程): 遵循網站上描述的調查路徑:(1) 打開用戶會話;(2) 檢查模型跨度以獲取延遲/代幣/狀態;(3) 閱讀工具/檢索/提供商調用周圍捕獲的事件;(4) 追蹤故障——錯誤仍然附加有消息/類型/堆棧/元數據。
11) 透過 OpenTelemetry (OTLP) 將追蹤導出到 SigNoz(可選): 啟用 OTLP 導出,以便相同的工作流程追蹤可以轉發到 SigNoz 等 OTLP 目標。該網站描述了一個導出管道:TraceLLM API → OTLP Collector → SigNoz,允許您將產品級別的追蹤保留在 TraceLLM 中,同時也將它們發送到您的可觀察性堆棧。
12) (替代方案) 如果您指的是 MCP 伺服器「Tracellm」記錄器,請運行它並調用其工具: 一些來源描述了一個純 MCP 伺服器,公開了三個工具:`log_action`、`get_logs` 和 `get_summary`,帶有 SSE-over-HTTP 傳輸(端口 8001)。在該設置中,您的應用程式/代理在有意義的交互(用戶消息、LLM 響應、工具調用、錯誤)後調用 `log_action`。日誌記錄設計為非阻塞:如果伺服器不可用,主要的 LLM 流將繼續而不中斷。
13) (替代方案) 如果您指的是研究 TraceLLM 存儲庫,請設置環境並運行預處理: 其他來源描述了研究代碼庫(例如,微服務調用圖追蹤生成),其設置如下:創建一個 conda 環境 (python=3.8),安裝 poetry,運行 `poetry install`,然後在 `trace_gen` 下安裝額外的要求。他們還描述了預處理腳本,用於將追蹤轉換為調用圖並計算統計數據(例如,`trace_to_cg_stats.py`、`merge_cg_stats.py`),以及將調用圖轉換為文本表示,並適當地設置 `task_type`。
TraceLLM 常見問題
TraceLLM 是一個 LLM 可觀察性和追蹤產品,它記錄 AI 工作流程活動——提示、跨度、代幣、錯誤和模型呼叫——因此您可以在單一的端到端追蹤中調試和理解發生了什麼。











