大约两百年前,法国人尼埃普斯将一块涂有感光材料的白镴板放进暗箱,对准窗外。
光线穿过镜头,落在这块金属板上。经过漫长的曝光,窗外的风景留下了一些模糊的明暗。这张《窗外的勒格拉景色》,通常被视为现存最早的相机照片。
此后近两百年,摄影技术经历了无数次变化。其中的核心并没有变——真实存在的东西反射或者发出光线,光穿过镜头,在感光介质上留下痕迹。
「照片」的词源,正是「光的书写/光的图」(photo-graph)。这个词本身就隐含着一层意思:画面里的那一刻,曾经真实发生过。
但也是在摄影术诞生后的两个世纪里,照片对于「真实」的映射其实早已被消解。
如果你看过电影《寂静的朋友》,里面那种人工修饰底片的技术,在 19 世纪末期就已流行开来。数码时代来了,Photoshop 的事情则更无需篇幅赘述;而到了生成式 AI 浪潮骤起的今天,一张「看起来真实」照片与现实之间那种理所当然的联系,早已荡然无存。
我们怎么证明,一张照片真的来自现实世界?
作为世界上最多人使用的拍照设备的生产商,苹果给出了自己的答案——Apple Reference Image (苹果参考图像)。
图|Apple
把「水印」刻进传感器
可见水印也有一个明显的弱点,裁切、修图,甚至只需要再交给另一个 AI,就能让它从画面中消失。
近几年,谷歌推出的 SynthID 技术,在 AI 防伪和 AI 鉴别领域流行了起来,包括谷歌自身以及 Anthropic、OpenAI 等公司都在采用。这是一整套包含文本、图像等各种模态的「隐水印」技术,具体在图片上,也是将肉眼不可辨别的数字水印嵌入图片。
但是它仍然有识别上的局限性,比如一般人在看到一张照片、一段文字的时候,是不懂、也不会使用 SynthID 校验工具来验证真伪的。
既然已经越来越难判断一张图片是真是假,与其继续给 AI 生成的内容打上「假」的标记,另一种思路是:
给真正由相机拍下来的照片,留下「真」的证明。
这也正是 Apple Reference Image 的核心思路。
当然,给真实照片打上一枚「水印」,也不是在照片上盖一个「Shot on iPhone」的水印那么简单。
毕竟我们凭什么相信,盖章之前的照片就是真的?假如一张照片已经完成处理、生成了 JPEG,系统才给它附上一份无法伪造的凭证。那这份凭证最多只能证明,照片在盖章之后没有被改动。至于盖章之前,它有没有被替换、有没有经过篡改,凭证本身并不能回答。
要让这份证明真正可信,必须把信任的起点继续向前推。一直推到数字摄影最接近现实世界的地方——
传感器。
当光线穿过镜头,抵达相机传感器,并在那里被转换成数字信号,现实世界便第一次以像素数据的形式进入手机。
苹果选择在这里建立信任的起点。
我们将它称为「水印」,但其实是一份由传感器为捕获数据提供的密码学签名。iPhone 18 Pro 和 iPhone 18 Pro Max 开启参考模式后,主摄传感器会进入专门的安全捕获模式。
传感器捕获原始像素,随即用内部私钥对这些原始数据进行签名。硬件机制还会阻止传感器固件在签名前修改这些数据。
这样,签名保护的便不止是传感器输出了什么,还包括它输出的图片数据,与实际捕获结果之间的关系。
从一张照片,到一条信任链
图|徕卡
值得关注的是这个凭证生成的时间节点:是在 JPEG 照片文件生成时建立的。
从传感器捕获原始像素,到文件生成,图像已经走过一系列处理步骤。
如果数据在签名前遭到替换或者篡改,最终文件即使获得有效签名,也未必忠实于传感器最初捕获的画面。
这也是苹果试图通过 Reference Image 进一步回答的问题:如何建立一条从原始捕获,到最终成片,都能够接受验证的信任链?
首先,系统得确认签名的传感器确实属于这台 iPhone。
在生产阶段,传感器会生成专属密钥。私钥留在传感器内部,公钥则用于验证签名。
iPhone 的安全隔区 (Secure Enclave) 也会建立独立的签名身份。苹果通过设备硬件清单,把两者记录为同一台 iPhone 的部件。
到了验证时,系统既能检查像素的传感器签名,也能核对这颗传感器与安全隔区是否属于同一台出厂设备——只有两者相互吻合,设备身份这一环才能通过验证。
当然,我们也不能完全保证「从传感器进入」就是绝对安全的,苹果并没有假设传感器本身永远不会被攻破。
假设攻击者成功破解某颗传感器,获取了其中的私钥,就有可能利用这把密钥,为伪造的图像数据生成有效签名。
换句话说,即使信任链的起点遭到攻破,苹果仍然保留了让相关照片失去有效认证的能力,不会让一把泄露的私钥永久成为伪造照片的通行证。
说真的,这么干的现实意义不大,但苹果就是把照片的设备级加密验真,做到了这么决。
设备身份确认之后,还得知道照片是什么时候拍的。
普通照片的 EXIF 会记录拍摄时间,但它通常依赖设备时钟。用户可以手动修改时间,遭到入侵的操作系统也可能提供虚假的时间信息。
图|Discover Digital Photography
因此,Reference Image 还需要一份独立于系统时钟的时间依据。
iPhone 会定期从苹果的密码学时间戳服务获取经过签名的时间凭证,全球平均约每 15 分钟一次;拍摄完成后,还会再请求一份新的时间凭证。
通过两个可信的时间点,把拍摄行为夹在中间。苹果无法证明照片是在具体哪一秒拍下的,但可以证明,它产生于这两个经过验证的时间点之间。
换句话说,Reference Image 提供的是一个「相对模糊,但绝对可信」的时间戳。即使拍摄时没有网络,后一份时间凭证也可以在恢复连接后补齐。
至此,传感器捕获的原始像素、相关元数据、传感器与安全隔区的签名、设备硬件清单,以及可信时间信息,会被打包成一份安全数字底片 (Secure Digital Negative),以 DNG 格式保存在 iPhone 中。
但底片还不是我们最终看到的照片。
RAW 到 JPEG,还要经过一系列图像处理。如果成片过程遭到篡改,前面建立的可信关系就可能在最后毁于一旦。
因此,这份底片还需要在可信的环境里完成「冲洗」。苹果把这一步交给了私有云计算 Private Cloud Compute(PCC)。
当我选择生成 Reference Image 时,PCC 会先核对原始像素、签名、证书、设备身份和时间信息,确认它们能够组成一条完整且相互吻合的证据链。验证通过后,PCC 才会处理 RAW 数据,生成最终的 JPEG,下载到用户设备本地。
这套流程真的太「复古」了:它就好比你真的拍了一卷胶片(对应苹果的安全数字底片),然后把胶片送到冲印店(对应苹果的 PCC 服务器)去完成冲洗。
但是我们又凭什么相信,苹果的云端服务是「可信的环境」?
苹果的解决办法,是让云端服务本身也成为可以被验证的对象,不只是依靠苹果的单方面背书。
PCC 正式部署的软件版本,会被记录在受到密码学保护的透明日志中,对应的二进制文件也会向外部安全研究人员公开;上传底片之前,iPhone 还会确认目标服务器运行的是日志中记录的版本。
还有一个有意思的细节,PCC 的验证并不止于照片本身,它再次把目光放回这条信任链的源头,也就是传感器。
除了核对密码学签名,PCC 还会额外运行一个神经网络,检查图像是否具有苹果相机传感器原始输出应有的物理特征,并生成一份可信度评分。
这些评分会与照片的唯一标识符、传感器 ID 等信息一起交给苹果的撤销服务,用于持续评估传感器的可信状态。如果某颗传感器持续产生了异常的图像数据,苹果就可以据此发现潜在的安全风险,并在必要时撤销与这颗传感器关联的照片认证。
前面提到,每颗相机传感器都有自己的专属密钥,苹果也能通过设备硬件清单,确认照片来自哪台 iPhone。
那么,如果有人拿到多张 Reference Image,能否通过其中的传感器身份信息,判断它们是否来自同一台设备,进而追踪摄影者的活动?
对普通用户来说,这或许只是一个隐私问题。不过,对于身处冲突地区的战地记者,或者正在调查敏感事件的摄影者来说,暴露拍摄设备的身份,可能意味着更加直接的人身安全风险。
因此,苹果没有把传感器的内部身份凭证公开在最终图像里。对于外部验证者来说,他们只能看到苹果为最终照片提供的签名,形象的来说只能看见苹果为照片盖上了一枚「经过可信相机捕获」的印章。
一种很「苹果」的产品逻辑
当然,Reference Image 也有它的边界。
举个最直接的例子:我们完全可以用 iPhone 拍摄电脑屏幕上 AI 生成的假图。即使最终照片通过了全部验证,也只能证明相机确实捕获了屏幕上的画面——并不能证明画面中的事情曾经真实发生过。
苹果在官方文档中,也为这项技术划定了一个明确克制的证明范围:
一颗可信的 iPhone 相机传感器,在某个经过验证的时间范围内捕获了这些光学数据,而这些数据随后经过了可验证的处理。
这也意味着,在 AI 时代,我们还是无法简单地证明「画面里所讲的故事是真实的」;但至少,苹果的方案能够让一张照片多了一份关于自身来历的真实记录。
一家生成式 AI 公司,最自然的做法是在自己生成的内容上留下标记。Google DeepMind 的 SynthID ,在 AI 生成的图片中嵌入人眼难以察觉、但可以被专门工具识别的数字水印。
一家传统相机厂商,则更容易从拍摄设备本身出发。前面提到的徕卡 M11-P,就是通过机内安全硬件,为相机生成照片内容凭证。
现在我们再回过头来看 Apple Reference Image,就能发现这是一项非常「苹果式」的功能产品。
这套流程里,每一步都需要不同环节的配合。苹果能够把它们串起来,一个重要的前提是:从相机硬件、操作系统到云端服务,这些环节都在苹果自己的强大的掌控之中。
这让我想起苹果当年做灵动岛的方式。
屏幕上的挖孔原本只是一个硬件结构,苹果让系统动画、通知和应用状态围绕它重新组织,最后把它变成了可以交互的界面。
灵动岛的成立,依赖于硬件设计、系统交互和应用能力之间的协同。苹果把这些原本属于不同技术层级的能力,放在同一套产品逻辑里考虑,最终形成了一项完整的功能。
Reference Image 与灵动岛虽然是两种完全不同的功能,但它们背后有着相似的产品思路。
它或许只是苹果应对 AI 时代的一次尝试。但从一个具体的问题出发,再用整个产品体系的能力去解决它,这样的解决方案,仔细想想好像确实 Only Apple Can Do。
作者|方俊鸣
编辑|杜晨





京公网安备 11011402013531号