cache
-
KV Cache 与 Prompt Cache:区别在哪,又有什么关系
大模型每生成一个 token,都会用到前面的内容。如果每一步都从头计算,回答会慢很多。做 Agent 时,同一套 system prompt、工具定义和对话历史还会被反复携带;如果每次都重新处理,延迟…
大模型每生成一个 token,都会用到前面的内容。如果每一步都从头计算,回答会慢很多。做 Agent 时,同一套 system prompt、工具定义和对话历史还会被反复携带;如果每次都重新处理,延迟…