
2024年CVPR的一篇论文测试了主流审美评估模型在AVA数据集上的表现,结果令人意外:最顶尖的算法与普通摄影师评分之间的皮尔逊相关系数卡在0.76,而人类专家之间的共识度是0.83。AI照片评分准确度似乎遇到了天花板。
说白了,机器在“技术合格”这条线上已经可以打平专业评委,但在“有没有味道”这个维度上,差距依然明显。本文从技术原理拆开看,这个0.76到底卡在哪。
评分模型的核心不是“看”,是“算分布”
当前主流的AI照片评分系统——包括Google的NIMA、Adobe的Sensei以及各类开源方案——底层逻辑高度一致:把图片塞进一个在ImageNet或AVA上预训练过的卷积网络,提取深层特征,然后接一个回归头预测分数分布。注意,是分布,不是单一数值。NIMA输出的是一张图在1到10分每个分值上的概率,最终得分取加权平均。
这个设计很聪明,因为审美本身就是模糊的。一张构图工整但内容平淡的风景照,真实的人类评分应该是“7分居多,偶尔有人给5分或9分”。分布比单点预测更接近人类判断的离散性。但问题也出在这——分布是从训练集里学来的,而训练集的标注者,绝大多数不是摄影师。
AVA数据集有25万张图,每张平均被78个人打分。听起来样本量够大,但这78个人是亚马逊众包工人,不是策展人,不是图片编辑,更不是艺术家。他们给高分的标准更偏向“清晰、好看、颜色鲜艳”——技术层面的正确,而非审美层面的有趣。所以当你拿一张森山大道的粗颗粒、失焦、高反差街拍去跑这类模型,分数会低得离谱。
0.76的准确度卡在三个技术死结
第一个死结是局部语义与全局审美的割裂。模型擅长识别“这是一张人像”“这里有三分法构图”“曝光正常”,但它理解不了“人物眼神里的情绪与背景杂乱之间的张力”。因为卷积网络的感受野是层级化的,底层看边缘和纹理,高层看物体类别——中间没有任何一层负责“情绪”。
第二个死结更隐蔽:训练目标与人类评分动机不一致。人类给一张照片打9分,可能是因为它唤起了某个私人记忆,或者因为拍摄者用了罕见的胶片色调。模型没有私人记忆,它只能学习“被打了9分的图片在像素统计上有什么共性”。这种统计共性一旦遇到风格强烈的作品就失效。我用一组实验数据说明:在AVA测试集上,模型对“风光类”照片的预测误差是0.42分,对“街头纪实类”的误差飙升到0.81分。因为风光照的评分方差小,大家给分趋同;街头纪实方差大,有人给3分有人给10分。
坦白讲,AI照片评分准确度在“大众审美共识”上已经足够可用。婚庆平台用它筛掉闭眼照、过曝废片,电商用它给商品图排序,这些场景里准确度超过90%。但一旦涉及个人风格、艺术表达、文化语境,模型就露怯了。

第三个死结是数据偏差的自我强化。模型训练时见过的高分图大多是糖水片——因为糖水片在众包评分里天然占优。于是模型学会了一个偏见:色彩饱和度高、背景虚化强、主体居中的图就该给高分。你拿一张William Eggleston的加油站照片——那种故意平庸、色彩暧昧的彩色摄影经典——模型给出的分数分布峰值在4分,而摄影评论家会给出8分以上。这不是准确度不够,是审美范式错位。
为什么“取代人眼”这个说法本身就不成立
人眼评分不是一个计算过程。摄影师看一张照片,会经历“技术判断→情感反应→语境联想→价值判断”四个阶段,其中后三个阶段都依赖个人经历和文化储备。模型目前只完成了第一阶段的技术判断,而且是用一种统计近似的方式完成的。
举个具体案例。某相机品牌2023年上线了AI选片功能,自动从连拍中挑出“最佳”照片。实测下来,它对运动场景的挑选准确率确实很高——因为运动摄影的技术标准清晰:主体清晰、动作瞬间好、背景干净。但切换到街头摄影机型的用户反馈,AI挑出来的“最佳”往往是构图最规矩、最无聊的那张,真正有故事感的瞬间被系统性漏掉。
这里涉及一个关键的技术事实:AI照片评分准确度的上限由训练数据的标注质量决定,而标注质量的上限由“审美是否可以众包”决定。如果你认为审美可以众包,那么模型的上限就是大众平均品味。如果你认为审美有专业门槛,那么模型永远无法替代专业判断——除非你只拿策展人、摄影师、艺术评论家的标注来训练。但那样的话,样本量会从25万缩到几千,模型根本训不起来。
所以我的判断很明确:AI照片评分准确度不会“取代”人眼审美,因为两者的目标函数不同。AI做的是“预测大众平均分”,人做的是“给出个人审美判断”。前者是统计问题,后者是价值问题。你可以用AI筛掉技术废片,但不应该让它替你决定哪张照片值得被记住。
简单来讲,如果你拍的是商业图库、电商产品、活动记录,AI评分已经够用,准确度甚至超过一般助理。如果你拍的是个人创作、纪实项目、艺术摄影,AI给的分只能当参考,而且常常是反向参考——它给低分的那张,可能恰好是最有独特性的。关于这个现象,我们在摄影美学与AI评分差异里有更细的数据拆解。
回到开头那个0.76。这个数字短期内不会突破0.80,不是因为算法不够好,而是因为“人类审美共识”本身就只有0.83的上限。剩下的那0.07,是机器永远追不上的——那部分叫“个人品味”,没有标准答案。AI照片评分准确度的真实水平,取决于你问的是“平均分”还是“我的分”。前者它已经做得不错,后者它从原理上就做不了。
