图像 patch 切块演示
模型从不直接看像素——图先被切成一堆 patch 小方块(ViT 经典 16×16),每块压成一个 token,和文字 token 一起喂进去。上传一张图,调 patch 大小,看它被切成几行几列、吃掉多少 token:一张随手发的图,几百上千 token 轻轻松松,把你的对话历史挤出窗口。
纯前端 canvas 切块,按
⌈W/p⌉ × ⌈H/p⌉
公式算 token 数,零 API、零延迟。
把图切成 patch
每个 patch = 1 个 tokenpatch 大小16×16 px
ViT 经典 16×16,各家模型不同。越小→块越多→越费 token;越大→越省但丢细节。
图尺寸
320 × 320 px
切成
20 行 × 20 列
图占 token = patch 数
400
≈ 400 个中文字的体量(1 patch ≈ 1 token ≈ 1 中文字)
一张随手发的图,几百上千 token 轻轻松松——在固定大小的窗口里,这些 token 把你的对话历史挤出去了。 (这也是 AI 看图会「看错小字」的根源:细节在 patch 压缩里丢了。)