一张照片到底还能压多小?

2025年2月,国际图像专家组正式发布 JPEG AI,标志着AI首次真正进入图像压缩国际标准体系。这个诞生于1992年的数字图像“基础语言”,终于开始被人工智能改写。

但问题在于,即便是JPEG AI,也仍未真正解决“人眼觉得好看”这件事。

传统图像压缩长期依赖PSNR等数学指标,但高分并不代表观感更好。人眼在意的是文字是否清晰、边缘是否自然、纹理是否真实,而不是单纯的像素误差。

苹果工程师团队近日发布论文,给出了自己的答案:PICO。

PICO全称为Perceptual Image Codec,核心目标不是让数字更漂亮,而是让人眼看起来更舒服。

PICO解决了三个老问题

首先是速度问题。

传统高精度熵编码需要逐步预测像素信息,压缩效果好但速度很慢。PICO采用“One-shot Context Model”,一次性完成关键参数预测,既保留压缩精度,又避开速度瓶颈。

其次是AI生成的“幻觉”问题。

感知压缩容易让图像看起来更真实,但也可能凭空生成错误纹理,尤其是文字区域最容易翻车。为此,PICO加入TextFidelityLoss,专门识别文字区域并强化像素保真,显著降低文字变形。

第三是分块压缩带来的色差问题。

为了适配手机芯片,PICO会将图像切成瓦片处理,但这容易产生拼接痕迹。苹果团队通过TilingArtifactLoss,让不同瓦片之间的色彩和亮度保持一致,减少边界伪影。

文件更小,观感更好

苹果团队没有只看实验室指标,而是委托第三方平台进行大规模人类盲测。

610名评测者完成近7.5万次配对比较后,结果显示:在相同视觉质量下,PICO所需文件体积仅为AV1、VVC、JPEG AI等主流标准的30%至43%。

换句话说,同样一张图,PICO可能只需要传统编解码器三分之一到二分之一的空间。

更关键的是速度。

在 iPhone 17 Pro Max 上,PICO编码一张1200万像素照片仅需230毫秒,解码约150毫秒,已经具备消费级设备实时使用的可能。

不过,PICO在PSNR等传统指标上并不占优。这恰恰说明,苹果选择的路线并不是追求数学分数,而是优先优化真实观感。

图像压缩进入新阶段

PICO并非没有短板。

对于卡通、图表、示意图等规则化图像,传统编解码器仍可能更高效,因为这类内容更适合规则建模。

但它的重要意义在于:图像压缩第一次真正从“优化像素误差”,转向“优化人眼感知”。

过去三十年,JPEG、HEVC、VVC不断让压缩指标更好看;而PICO则试图回答另一个问题:哪些细节对人眼真正重要,哪些信息可以被安全遗忘。

这背后,是苹果从WaveOne团队延续而来的技术积累。WaveOne早年便专注神经网络压缩,后来团队加入苹果,而PICO正是他们在感知图像压缩方向交出的重要成果。

未来,当用户在苹果设备上分享照片时,可能不会察觉背后发生了什么变化。但在那一瞬间,AI或许已经替你决定:哪些画面细节该保留,哪些可以被悄悄压缩掉。

Leave a Reply

Your email address will not be published. Required fields are marked *

Trending