【Snapcompact:把长上下文“打印”成图片的省钱奇招】这种名为Snapcompact的技术并非通过算法精简文字,而是将多达4万字符的文本渲染成6×10像素密度的位图交给模型。在Anthropic等厂商的计费体系下,1万Token的文本转为图片后仅需支付约3279个Token的费用,输入成本直降三分之二。实验表明,Qwen2.5-VL、Claude和GPT等主流多模态模型能近乎逐字地从像素中恢复信息,在170k字符的长上下文测试中,其召回精度远超传统摘要。这其实是利用了大模型多模态定价的“套利”空间,也证明了视觉与文本在模型深层共享相似的表示结构。它提供了一种“非损压缩”的新视角:摘要会人为丢弃细节,而位图保留了数据的全息状态。但这种方法并非没有代价,模型“阅读”高密度图像会显著增加推理Token(Thinking Tokens)的消耗,如果单次对话生成的回复过长,省下的钱可能会被推理费抵消。对于需要维持长期记忆且对精度有一定要求的智能体场景,这是一种极具性价比的工程权衡。


