開源工具 pxpipe 將 Claude Code 的長篇文字輸入轉換為緊湊的 PNG 圖像,以降低代幣成本。
這個技巧之所以奏效,是因為 Anthropic 對圖像的定價方式。文字大約每個字元一個代幣,但圖像的成本是根據其像素尺寸固定計算,無論包含多少文字。將程式碼或 JSON 等密集內容渲染成圖像,每個圖像代幣大約可以打包 3.1 個字元。
pxpipe 將此概念實踐為一個本地代理。它會攔截對 Claude Code 的請求,並將龐大且靜態的部分(包括系統提示詞、工具文件和較舊的聊天歷史記錄)渲染成圖像。最近的訊息和模型輸出則以正常文字形式傳遞。下圖顯示了模型實際看到的內容:大約 48,000 個字元的系統提示詞和工具文件被壓縮到單一密集的 PNG 頁面中。
如果以文字形式呈現,這將花費約 25,000 個代幣;而作為圖像,則大約只需 2,700 個代幣。
根據開發者 Steven Chong 的說法,總體節省平均為 59% 到 70%。在一個 Fable 5 的演示中,會話成本從 42.21 美元降至 6.06 美元。如果這種有些奇特的技巧流行起來,AI 公司可能會透過提高圖像處理價格來應對。
這種方法也有其缺點。它是失真的,從圖像中讀取時,像雜湊值這樣的精確字串可能會變得混亂。處理速度也較慢,因為模型必須透過視覺編碼器來處理渲染的圖像,而不是直接讀取文字。
pxpipe 預設支援 Claude Fable 5 和 GPT 5.6。基準測試和評估結果已記錄在儲存庫中。Fable 5 在包含模型無法記憶的新隨機數的數學問題基準測試中,達到了 100% 的準確度。根據 Chong 的說法,Opus 4.7 和 4.8 大約會誤讀 7% 的渲染圖像,而 GPT 5.5 在圖像上下文方面的表現也較差。這兩個模型預設為關閉,只能手動啟用。
將文字作為壓縮圖像輸入給 AI 模型並不是一個新想法。Deepseek 建立了一個 OCR 系統,可以將文字文件作為圖像處理,根據其技術論文,該系統能將文件壓縮高達十倍,同時保留 97% 的資訊。



