开场
开场报幕
各位朋友,晚上好!欢迎观看服务器艺术“当代影像,路径及其可能”第十三期线上论坛。我们非常荣幸地邀请到国际摄影中心名誉院长、摄影理论家弗雷德·里钦(Fred Ritchin),摄影评论家、摄影家、策展人江融,艺术理论家藏策,青年学者陈国森,围绕“摄影在 AI 时代的转型”展开分享和讨论。本次线上论坛由斯蒂芬·肖尔(Stephen Shore)的学生夏靖宜担任翻译,在此表示感谢。接下来有请主持人、艺术理论家藏策老师。
藏策
我是今天的主持人藏策,欢迎大家来到服务器艺术“当代影像,路径及其可能”第十三期。今天我们非常荣幸地邀请到了国际摄影中心名誉院长、摄影理论家、策展人弗雷德·里钦先生,为我们做主题分享,题目是“摄影在 AI 时代的转型”。同时,我们还邀请了著名摄影评论家、摄影家、策展人江融老师,以及复旦大学哲学学院艺术哲学系博士生陈国森老师,一起来参加讨论。
我们还邀请了毕业于美国纽约州巴德学院摄影系的夏靖宜老师,她是肖尔的学生。上次与肖尔对话时,她也非常好地担任了翻译。感谢几位嘉宾,也请大家跟观众朋友们问个好。
今天这个题目非常重要,相信大家也都很关心:摄影在今天的 AI 时代,到底会面临哪些问题?恰好里钦先生不久前刚刚出版了新作《合成之眼:摄影在人工智能时代的转型》(The Synthetic Eye: Photography Transformed in the Age of AI),是一本非常新的专著。翻译成中文可能还需要一段时间,今天我们有幸请到里钦先生,面对面分享这本书的主要内容,让国内读者先睹为快。包括我本人在内,都非常期待。好,我话不多说,下面有请里钦先生开始今天的讲座。
摄影在 AI 时代的转型
里钦
感谢邀请。很高兴能和大家分享一些想法。
从 1984 年起,我一直在撰写关于数字影像对摄影的冲击的文章:它如何运作,我们怎样看待它,以及它能在世界上做什么。我最新的书叫《合成之眼:摄影在人工智能时代的转型》(The Synthetic Eye: Photography Transformed in the Age of AI)。
我的第一本书,就是左上角那本,叫《以我们自己的影像:摄影即将到来的革命》(In Our Own Image: The Coming Revolution in Photography),1990 年出版。这是世界上第一本关于数字革命对摄影冲击的书。我写它的目的是让人们知道即将发生什么。它比 Photoshop 发布还早,书里讨论的问题,我当时就知道我们在未来几年必须面对。封面影像来自第一部获得奥斯卡金像奖(Academy Award)的计算机生成电影。
之后我写了《摄影之后》(After Photography),2009 年出版。当时的感觉是,我们所理解的那种摄影基本上已经结束了,我们必须重新发明它。2013 年的《弯曲画框》(Bending the Frame)讲的就是这种再发明:我们能做些什么不同的事?我们怎样弯曲摄影的画框,让它在世界上继续发挥作用、继续产生影响?
最近这本就是《合成之眼》。封面是一张我用 AI 生成的影像,提示词(prompt)要求生成“浪漫的火星人”,仿佛通过 H·G·威尔斯(H. G. Wells)的眼睛看到的,就是那位写火星人入侵的作家。我一直在做的事情之一,就是看看非摄影师的人会做出什么样的影像。如果我们能够模拟照片,那么如果一个音乐家来拍照片,会是什么样子?一个作家呢?显然这些不是照片,但它们模拟了摄影的逼真效果。
补充一句,《摄影之后》也由南京大学出版社出了中文版。
人工智能模拟摄影影像的大众化使用,始于 2019 年一个叫“此人不存在”(This Person Does Not Exist)的网站。你在手机上不断刷新,就能看到不同的影像,看起来像是真人,但他们从未存在过。做这个网站是为了警告我们:人工智能即将来临,区分照片和模拟照片的影像将变得多么困难。




这一切在人工智能之前就开始了,起因是轻松篡改照片变得可能。这是 Photoshop 的早期使用案例。左边是墨西哥摄影师佩德罗·迈耶(Pedro Meyer)和他的儿子,右边是佩德罗·迈耶和他的父亲。同一个人出现了两次,一次当父亲,一次当儿子。几十年前,这就预示了家庭相册可能变成什么样:离婚后你可以把配偶从照片里删掉,也可以把不同辈分的人加进来。照片本身变得可以随意捏造了。

杂志和报纸上的一个标志性篡改案例发生在 1982 年,比 Photoshop 早了八年。那时候用的是赛天使(Scitex)或同类机器,价格大约在五十万到一百五十万美元之间。《国家地理》(National Geographic)有一张埃及吉萨金字塔的照片,他们需要把它放到竖版封面上。两年后,1984 年,我采访那位编辑时,他告诉我这根本没什么大不了的:他们只不过是回到过去,把摄影师往旁边挪了几步,换了一个视角。换句话说,他们把左边的金字塔移到了右边金字塔的后面,好让画面适合封面。


对他来说没什么大不了,但对我来说简直是科幻。1984 年我为《纽约时报杂志》(The New York Times Magazine)写了一篇文章,据我所知,是全世界关于这个话题发表的第一篇重要文章。我在文中引入了像素(pixel)的概念,也就是图像元素(picture element),因为当时人们还不知道那是什么。我写道,在不太遥远的将来,看起来逼真的影像可能不得不像文字一样被标注为虚构(fiction)或非虚构(nonfiction),因为两者可能变得无法区分。我们可能必须依赖影像的制作者,而不是影像本身,来告诉我们一张图属于哪个类别:是虚构还是非虚构?
这是一张纽约市的照片,1984 年发表在《纽约时报杂志》上。我和一位赛天使机器的技术员一起操作。那时候你需要三块屏幕,还得学习两周才能上手,不像 90 年代 Photoshop 出来以后那么简单。
我做了很多改动:我把旧金山的泛美金字塔大厦(Transamerica Pyramid)搬到了纽约,还把巴黎的埃菲尔铁塔也搬来了。我在埃菲尔铁塔周围制造了一场交通堵塞。右边,我把花旗集团大厦(Citicorp)的楼顶转了个方向。我把帝国大厦(Empire State Building)往上城方向挪了几个街区,还把它变高了。还有一些很小的改动:如果你看右边的水面,我加了一个码头。目的是展示改动一张照片有多容易,既有人们一眼就能认出的大改动,也有很小的改动,让大家可以对比。同样是一种警告。当时杂志印了一百六十万份,但我只收到了三封对此感兴趣的读者来信。


这是 1994 年,美国的杂志开始更多地使用这种技术。O·J·辛普森(O. J. Simpson),一位名人和体育明星,因涉嫌两起谋杀被逮捕。同一张洛杉矶警方拍的嫌疑人照片(mug shot)出现在两个封面上:左边是《新闻周刊》(Newsweek),右边是《时代》(Time)。《时代》做了手脚:他们把照片调暗了,弄模糊了,还加了聚光灯效果。

引起了很大的抗议。一周后,主编解释说,他们只不过是拿了一张普通的嫌疑人照片,把它提升到了艺术的高度,没有牺牲真实性。所以他的论点是,右边那张照片算是某种艺术,同时并未牺牲真实。这也许是人们意识到改动照片有多容易的一个高峰时刻。在 Photoshop 普及之前,杂志封面和广告里就经常这样做了。这改变了“照片是对可见事物的记录,是对可见之物和所发生之事的见证”这一观念。我记得当时有八百封读者来信,其中七百九十封指责《时代》搞种族主义:辛普森是名人的时候,皮肤浅一些;被指控两起谋杀的时候,他们就把皮肤弄深了。
据我所知,接下来这张是第一张“未来新闻照片”。摄影通常拍的是当下,看到的时候已经成了过去。这两位是在奥运会上竞争的花样滑冰选手,当时正在闹矛盾,而这张是她们第二天见面的图像。摄影通常拍不了“第二天”。右下角注明了这是一张合成插图(composite illustration),但这是摄影被用来描绘未来的开端。同样是 1994 年。

这是在伊拉克的一名士兵,布德罗下士(Lance Corporal Boudreaux),两边各站着一个男孩。右边的牌子写着“他救了我爸爸,救了我姐姐”;左边的写着“他杀了我爸爸,让我姐姐怀了孕”。我问过美国军方哪个版本是真的,因为两张都在网上流传。他们当时说,调查了一年也搞不清楚。网上的人随便做什么内容的牌子都行,想写什么就写什么。这说明,当篡改照片变得如此容易,想要了解世界上到底在发生什么是多么困难。这跟胶片摄影非常不一样,苏珊·桑塔格(Susan Sontag)曾经把胶片摄影比作脚印,通常不会被篡改到这种程度。我猜右边那张是真的。

这张瑞典飞机失事的影像,我记得是作为新闻照片在芬兰的八家报纸上刊登的。但现场没有摄影师。他们询问目击者当时的场景是什么样的,合成了一张影像,在 90 年代当作新闻照片刊发,没有摄影师,也没有相机。后来据说找到了一段视频,跟这张合成影像非常接近。意思就是:你不需要摄影师,也不需要相机,你可以编造出来。而这恰恰就是人工智能正在做的事。

1994 年,我为媒体的照片刊发提出了一个新标准。当一张照片被大幅修改时,就在上面放一个符号:方框内一个镜头,中间画一条对角线。读者就知道这张照片被大幅修改过了。理论上你还可以点击这个符号,查看具体改了什么。目的就是对读者诚实、公开,让他们知道照片是否被篡改。这是在 AI 出现之前好几十年的事。

以上这些论点都不意味着照片就是真相。摄影始终是主观的,始终是阐释性的。但按照惯例,特别是在新闻或纪实工作中,我们把照片看作是对可见事物的记录,或者用约翰·伯格(John Berger)的话说,是“从表象中摘取的引文”(a quotation from appearances)。我并不是说照片曾经是真相。我说的是,按照惯例,它一直被视为对可见事物的记录。
这是瑞典政府的一个举措,我觉得做得很好。他们做了一个假的杂志封面,上面是一位光鲜亮丽的年轻女性,然后展示了修改的过程。我想主要是因为他们不希望别的年轻女性试图让自己看起来像她,而她实际上根本不是那个样子。你可以点击她的嘴巴、鼻子、眼睛、头发,身体的任何部位,看看她真实的样子。这是在做科普:我们在媒体上看到的很多东西都是修改过的,并不像展示的那样存在。同样,这也是在人工智能之前。


这是《Vogue》早期的 AI 封面之一,是葡萄牙版《Vogue》(Vogue Portugal)的第一个 AI 封面。它引发了一种预感:时尚摄影也许不再需要摄影师、模特或化妆师了。一些公司认为这反而带来了更多的多样性:不同的体型,胖的、瘦的、高的、矮的,不同的族群,如果要雇模特、摄影师和化妆师,他们承受不起这种多样性。这是一个有意思的时刻:时尚摄影棚正在开始不用摄影师和模特了。一切都可以变成人工智能。

回到之前的话题,这是 1968 年平安夜从太空拍摄的第一张地球照片。十六个月后,1970 年 4 月,地球日(Earth Day)开始了。世界各地以这张照片为基础制作了邮票,传达的理念是我们必须保护自己的星球。如果人们不相信一张照片代表着某种现实、某种真正存在的东西,它就无法推动变革,因为人们不相信事情发生过。有些时候照片在推动积极变革方面发挥了极其重要的作用。现在的问题之一是,这种作用还能不能继续。



这是另一个例子,1972 年,一张照片帮助推动了越南战争的结束。第二年,1973 年,美国从战争中撤出了全部士兵。世界上有这么多暴力,但照片有时确实帮助推动了积极的改变,比如让一场战争更早结束,等等。不幸的是,这种情况越来越少了,正如我们在当前的冲突中看到的,比如乌克兰和加沙。
这张影像也来自越战时期,一位抗议者把花放在了士兵面前。它对美国的反战运动产生了很大影响。当时我们还有印刷媒体,不只是网络媒体,还有报纸和杂志的头版。照片在那个年代也更可信。它在社会中是有用的,能推动事情改变,有时候是往好的方向改变。

同样,2015 年,十年前,一个两岁的男孩和家人一起在逃离叙利亚的途中溺水身亡,那张照片在全世界引发了改变。为难民募集了更多的资金,一些国家接收了更多的难民。在我看来,这可能是最后一张改变世界、使之更好的标志性照片(iconic photograph),因为我们不再拥有以前那种新闻体系,也不再拥有那种可信的、令人信服的摄影了。这些是那张照片在世界各地产生影响的部分例子。

摄影师们现在正在发明新的方式来产生影响。这些是马萨诸塞州的老人,退伍军人,大约六十人在养老院里死于新冠(COVID)。为了纪念和缅怀他们的生命,美联社(Associated Press)摄影师大卫·戈德曼(David Goldman)把他们年轻时的照片投影到了家属住所的外墙上。不是报纸的头版,而是房屋的外墙。这是世界各地的摄影师正在重新发明这个媒介、在一个不同的时代产生影响的方式之一。

合成影像的实验与可能性
好几年来,我一直在用文字提示词(text prompt)配合不同的 AI 系统实验生成影像。这些工作中很大一部分并不是试图通过模拟逼真影像来与摄影竞争。比如这一张,是尝试描绘浪漫的火星人。没有人拍过火星人,也没有人见过火星人。这更接近幻想,而不是试图与真实竞争,而且它采用的是一位已故作家的视角,就是那位写了关于火星人入侵的《世界大战》(The War of the Worlds)的作家。
在数字媒体中,一旦某样东西变成了代码,你可以用任何你想要的媒介输出它。一幅画可以变成音乐,音乐可以变成照片或文字。我们把这叫做跨媒介(transmedia),不是多媒体(multimedia)。在这里我是用一位作家的作品来将某种东西呈现为影像。
这是我用提示词“有史以来的第一张照片”生成的 AI 影像之一。我总是尽量在下方或旁边注明这是合成影像(synthetic image),不是照片。这一张是 2023 年 8 月由 DreamStudio 根据我的文字提示词生成的。这是同一时间生成的另一个版本。它让我想到罗兰·巴特写过的,他注视着那个兄弟的眼睛,而那双眼睛曾经注视过拿破仑。我们知道,AI 系统在网上抓取了数十亿张影像,连同关键词和图说,学习它们的构造方式,再构造出新的影像。

这里有一个重要的观点要说明:我们经历了从十九世纪和二十世纪的光学摄影(optical photography)(光线穿过镜头记录在胶片上)到计算摄影(computational photography)的过程,在计算摄影中,相机内的算法(algorithm)或 Photoshop 这样的后期软件对光线进行修改。它们改变它,操控它,增强它,无论你用什么说法:让人变瘦,改变肤色或背景。
到了人工智能,我们甚至不需要镜头或相机了。我们模拟逼真的影像。所以这是一个从光学摄影到计算摄影、再到 AI 的序列。一个问题是:计算摄影还算不算摄影,还是另一种成像形式?当然,对于 AI,我使用“合成影像”这个术语。我从不说“照片”,因为这些不是照片。
我给大家看大约十来张 AI 影像。搜索引擎越来越多地提供帮你生成影像的功能,而不只是帮你找到一张。这样一来,人们可以随意重新配置历史。这个月我输入了“明朝时期的长城”。这是它给出的一张影像。明朝时显然没有摄影,所以很难确认长城当时是不是这个样子。这些就变成了潜在的历史、可能的历史,而不是对可见事物的真实记录。

同样,我要求生成一张 1815 年柏林街景的照片。1815 年既没有汽车也没有摄影,但这对 AI 系统来说不成问题。历史可以在没有任何依据的情况下被捏造出来。这影响了我们对当下和过去的参照系,也影响着未来。

这是亚伯拉罕·林肯(Abraham Lincoln)在自拍。1860 年代显然没有手机,但对这个 AI 系统 DALL·E 来说,编造这样一张影像完全没问题。一个做学校论文的年轻人也许并不知道这一点。历史变成了你想让它成为的样子,而不是实际可能发生过的样子。我们知道非虚构并不总是非虚构的,但这里完全就是编造。

这是美国总统,仿佛由一个孩子拍摄的。我想看看 AI 如何阐释一个孩子可能看到的东西,或者一只动物可能看到的东西。AI 可以做出跟摄影不同的东西,给我们提供关于不同视角可能是什么样子的思路。

这些影像大部分都收在《合成之眼》里。这又是恋爱中的浪漫火星人,这次灵感来自小说家弗吉尼亚·伍尔夫(Virginia Woolf)的作品。她不是摄影师,但我想看看 AI 会怎样根据她的写作来阐释她可能构建影像的方式。这引出一个想法:所有照片都是建构物。摄影是社会再现真实的一种方式;它不是真相,也不是绝对的现实。相比之下,用 AI 工作可以是对摄影的一种评论,也是理解摄影实际上在做什么的一种途径。

这里我输入的是“1945 年的一张标志性照片”。有时候这些 AI 系统似乎更有超现实的感觉,而不是现实感,甚至可以说有一种幽默感。它们给出的东西有时让我非常吃惊。我在《纽约时报杂志》和其他出版物担任图像编辑(picture editor)的时候,通常能很好地预判摄影师从拍摄任务中带回什么样的东西。拍一个作家,他们通常会拍那个人坐在桌子后面,身后有书,当时还有打字机。但这张完全出乎意料。我根本没想到它给出的 1945 年标志性照片会是这样。

我输入的是“一张完美家庭的照片”。结果又让我意外:没有女性作为母亲。AI 系统经常因为种族歧视或厌女被批评,主要是因为它们在网上学习的影像本身就经常包含种族歧视或厌女的内容。但有时候这个系统似乎是被解放了的,有着跟传统观念不同的想法。这不是我预期的,但我看到的时候非常高兴。

这是纽约市哈莱姆区(Harlem)的一个街景,风格是二十世纪爵士乐手的。很多伟大的爵士乐手来自哈莱姆。我想看看 AI 怎样阐释一个爵士乐手的视角。我觉得其中的变形、节奏和那种可能性很有意思。它以某种方式显得生机勃勃,有点像爵士乐的视觉阐释。一些最有意思的 AI 影像不是逼真写实的,而是带有某种扭曲变形的。

我要求生成一张 2045 年奥运会乒乓球冠军的照片。我经常实验 AI 怎么看待未来:二十年后谁会获胜?这是它给出的一个回应。摄影拍不了未来,但 AI 可以描绘一种可能的未来。比如说,如果它展示了北京、纽约或巴黎在二十年后,假设我们对气候变化什么都不做的话会是什么样子,那可能是有益的。也许我们会因此采取行动保护自己,因为 AI 向我们展示了一种可能的未来。

这里的提示词是“一个越战士兵在自拍的照片”。右边这张是我新书的封底。越战期间没有手机自拍,但 AI 系统毫无问题地给我做了一张。这是越战结束后在纽约的胜利游行。并没有胜利游行。士兵们回来后,人们对他们往往不太友善,因为大家反对那场战争。但你可以制作这样的影像。即使在这个领域工作了五十年,我现在也越来越难分辨一张是真正的照片还是 AI 生成的逼真影像。两者越来越难以区分了。



有些系统里,你输入一条提示词,会得到四张可能的影像。这里的提示词是“后像”(the afterimage):影像之后你看到了什么?这是四种可能,我觉得非常有诗意,是对“后像”的一种雄辩的阐释。我一直在做一个叫“条带”(Strips)的项目,就像摄影里老式的小样(contact sheet),你从中选择哪些影像要放大使用。

有一个重要的点:如果我第二天输入同样的提示词,通常会得到非常不同的影像。这跟摄影有点像:如果你在某个时间没有拍下一张图像,将来就拍不到了。这里的提示词是“一张和平的照片”。这是我得到的结果,但用同样的提示词不会再得到它了。有一个拼写错误,末尾多了一个“at”,不该在那里。它让你产生疑问:为什么左边那个女孩的手指是那样的?那跟和平有什么关系?它为什么选了其他那些影像?什么意思?大部分时候我都在问:AI 通过它选择的影像在告诉我、告诉我们什么?有时候我也不确定自己理解了它到底想表达什么。

这里的提示词是“一张性别歧视的照片”,大概是针对女性的。同样,我觉得有意思的是去搞清楚这些影像意味着什么。它们能被严肃对待吗?又该怎样阐释它们?

几年前,我输入了“当今最令人警醒的气候变化照片”。几秒之内它就生成了一幅双联画(diptych)。我并没有要求两张影像。你看到一个时钟表示紧迫,一口石油喷泉,一头北极熊,正在融化的冰和太阳。单独一张照片做不到这些。我觉得有意思的是,AI 创造了一张复杂的影像,暗示气候变化是多个问题同时发生的。

这里我输入的是“一个无家可归的摄影师拍摄的、关于无家可归者的合乎伦理的照片”。我想看看它跟一个有家可归的摄影师拍的会不会不同。这个人看起来更快乐、更机敏、更有活力,直视着摄影师的眼睛。他不是一个悲惨的、刻板印象中的受害者。他看起来就像一个普通的人,可以快乐、温暖、机敏、聪明,可以有想法,只是没有家。这跟很多关于无家可归者的刻板印象不同。

这是一个我一直以来的问题:有没有一张关于战争恐怖的照片,能够终止所有战争?这是许多在战区工作的摄影师的梦想:我能不能拍一张终止所有战争的照片?这张 AI 影像没有展示暴力的奇观。它展示的是暴力对旁观者、观看者的冲击。小女孩大概是摄影师的女儿,而战争恐怖到某种程度,以至于把相机压碎了。我们必须去想象那种暴力、破坏、伤害和痛苦。我们不是窥视暴力的旁观者;我们是有责任的观看者。我没有预料到 AI 会展示战争对我们的冲击,以及由此暗含的、我们作为世界公民确保不再有战争的责任。

这是“世上最美的女人”。我没想到会是这样。她看起来不像时尚杂志的封面人物,也不是什么超级优雅的形象。她更普通一些,我对此感到惊喜。这张影像是差不多三年前生成的。最近这些系统生成的影像往往更加常规,不那么出人意料,更像你预期中的样子,好像它们在试图以一种主流的方式取悦你。不总是这样,但经常如此。

这里的提示词是“一张两个火星人的画意摄影照片”。画意摄影(Pictorialism)是摄影的一种风格,特别是在十九世纪,模仿绘画的外观。我想看看 AI 怎么阐释它。我觉得结果非常超现实主义。我用火星人的提示词做了很多影像,因为没有人拍到过火星人。我想看看 AI 怎么阐释那些从未被拍摄过的东西。

我输入了“世上最伟大的母亲们的照片”。我以为会是人类、女性,但它给了我动物。我意识到自己的思维有多狭隘,想当然地认为最伟大的母亲一定是人类,而各种动物可能同样是伟大的母亲。

这是“一个不快乐的机器人的照片”,机器人(bot)就是执行重复性任务的软件程序。我想,机器也许更懂机器。我做了一个系列,看 AI 怎么描绘机器人和算法,看看它对“一个不快乐的软件程序可能长什么样”有什么洞见。

显然,没有人能拍到死后看到的东西,所以我让 AI 来展示。我做了一个系列。我发现这些影像让人感到安慰,因为我开始想到所有的生物有机体(植物、动物、人类、昆虫)都会死亡。你不是独自死去的;你是作为生命宇宙的一部分死去的,而这个宇宙中的生命终究都会消逝。这是另一个实验,看 AI 如何展示无法被拍摄的东西:在这个例子里,就是一个人死后最先看到的东西。这是第一部分的结尾。

这些是我为了引发讨论而生成的影像:在从未有过女总统的国家里的女总统们,或者美国的第二位黑人总统。《Vogue》的一位朋友让我用“以辛迪·舍曼(Cindy Sherman)的风格拍摄的、作为年长女性的自画像”作为提示词。这里有一个伦理问题。舍曼以自拍肖像闻名。这样做对吗?使用别人的风格合乎伦理吗?有些艺术家说不行。但我也遇到过另一种看法:你是在承认、尊重和致敬你所追随的那位艺术家。

同样,斯蒂芬·肖尔让 AI 生成了一张类似他自己照片的影像,发到了 Instagram 上。我采访了他,问他对结果满不满意。他说,那张影像有他那种冷幽默,只是他自己会用大画幅相机拍,会有更多细节。这引出了一种可能性:一位艺术家去世后,如果他们生前认可了那个算法,它可以继续生成影像,或者他们的遗产管理人也可以这样做。

一两周前,我用 AI 做了一组自画像。右上第二张是我作为中国外交官的样子;左下第二张是从一只苍蝇、一只昆虫的视角看我。它们全部基于我的这张照片,我把它输入系统,看看系统在不同提示词下如何阐释。这些就是其中一部分阐释。

AI 影像的社会问题
现在我来谈一些重大问题。三星(Samsung)最近声称,有了 AI,不存在所谓的“真实图像”了。Adobe 说 AI 就是新的数码相机。谷歌(Google)说,如果你对过去的记忆跟照片不一致,你应该可以改掉照片。杰弗里·福勒(Geoffrey Fowler)在《华盛顿邮报》(The Washington Post)上写道,我们应该把相机更少地看作现实的反映,更多地看作 AI 在试图让我们开心。这些都是重大问题。科技公司就是这样看待这件事的。
研究发现,人们无法区分 AI 合成的面孔和真实面孔。不仅如此,人们觉得那些 AI 生成的、根本不存在的人的影像,比真实人物的照片更值得信赖、更可信。
一个越来越受关注的问题是深度伪造(deepfake),就是把某人的影像放进一段通常是色情的视频中。受害者几乎都是女性,常常是名人,但这也在学校里发生。有过这样的案例:男孩使用所谓的“脱衣”软件(nudify),拿一个女孩的脸,可能是十二岁的同学,用 AI 让她的身体看起来像裸体。这造成了巨大的心理创伤。特别是在欧洲和美国,这个问题正在引起关注并推动人们采取行动,尽管它仍在继续。
也许最糟糕的是,AI 正在被用来制造大量的儿童色情影像,有时候使用的是真实儿童的面部照片。这太可怕了。我知道中国的法规跟某些其他国家不同,但这个问题是全球性的:在一个国家制造的影像可以在其他国家看到。我的看法是,联合国、其他全球性组织和各国必须合作,限制危害,增加 AI 的建设性和积极使用。
创建了 Photoshop 的 Adobe 也销售供刊发使用的图库影像(stock image)。这里它推出了一张“AI 生成的照片”,是一位巴勒斯坦难民。这不是照片。如果它是 AI 生成的,那就是影像,不是照片。你可以坐在世界上任何一个地方的客厅或办公室里,制作关于其他人的影像,而不用亲自去那儿。有了摄影,你得带着相机到现场;现在不用了。

讽刺的是,Adobe 同时在牵头“内容真实性倡议”(Content Authenticity Initiative),追踪对影像所做的修改,包括用 Photoshop 做的修改。与此同时,它又在售卖这些 AI 生成的影像。这些是乌克兰的影像。这些人不存在;它们是 AI 做的,由那家牵头推动可信度的同一家公司出售。
也有一些努力,比如芝加哥的这个项目,开发软件来保护艺术家的影像不被抓取、扫描和使用,通常是未经许可的。有些软件甚至专门设计来扰乱 AI,降低它的效果。这些是小规模的努力,试图保护艺术家的作品不被那些极其富有的公司用来训练它们的系统。这里展示的一个叫“夜影”(Nightshade)。

这些是罗伯特·卡帕(Robert Capa)拍摄的著名的二战诺曼底登陆日(D-Day)照片。它们是标志性的。菲利普·托莱达诺(Phillip Toledano)现在用 AI 制作了卡帕可能在其他胶卷上拍到的影像,如果他当时用了那些胶卷的话。就是最近一两个月的事。他拿卡帕的真实照片(那些是重要的历史)来制作看起来像是卡帕可能拍到的 AI 影像。他在玩弄历史。这些全是 AI 影像。

这是卡尔·德·凯泽(Carl De Keyzer),玛格南图片社(Magnum Photos)多年的成员。他最近没有去俄罗斯,而是自出版了《普京之梦》(Putin's Dream),我想是几个月前的十二月。这些是 AI 生成的当今俄罗斯的影像,不用亲自去。玛格南图片社自 1947 年以来一直在见证和记录历史,所以它面临一个重大的决定。他是成员;他们怎么办?他们的决定是:成员可以做他们想做的事,但这些影像不会进入档案,因为它们不是照片。这不是历史;这是 AI。

AI 现在被很多报纸和杂志使用,有时标注为照片,有时标注为 AI。如果时间充裕,我可以给大家展示更多好的和坏的用法。有一个澳大利亚的案例,一些遭受过虐待的难民没有留下虐待发生时的照片。通过 AI,他们能够生成影像来呈现那些经历。那是一种更好的用法。还有很多问题可以讲,但我先进入第三部分。
如何建立摄影的可信度
第三部分是关于确保摄影可信度的三个想法。我们该怎么办?我长期以来的一个想法是,把新闻照片看作“从表象中摘取的引文”,约翰·伯格的说法。在写作中,如果你引用某人的话语或文字,你不能在不告知读者的情况下改动原话。把画框之内的东西想象成是在引号之中:你不能在不告知读者的情况下改动它。这是一个简单的想法。如果我们说这是一张新闻照片,每个人都知道其中没有任何东西被改动过,它是对可见事物的记录,除非我们另行说明。
你唯一能做的是稍微调整对比度、裁剪影像或清除数字噪点(digital noise)。超出这些范围的任何改动都必须公开说明。你也可以使用标签:左边是一张被大幅修改的照片,带有打叉的镜头图标;右边是我生成的一张 AI 影像。标签也可以标明这一点。

我参与创立了“以光书写”运动(Writing with Light)。“Photo”的意思是光,“graphy”是书写或描绘,所以 photography 就是以光书写。网站是 wwlight.org。在那里你可以看到我刚才讲的很多内容,我们上周发布了一份宣言。我们把摄影师视为影像的作者,就像作家是文字的作者一样。你不一定能信任相机去记录可见事物了,但你可以信任影像的作者(摄影师)是一个正直的人。你不是因为文字是文字就信任它们;你信任的是写作者。这个想法就是信任摄影师,而不是相机。
我们还把非虚构摄影(nonfiction photography)定义为:对可见事物的记录,其中摄影师力求以适当的语境,公正、准确地再现现实、事件、人物等等。
我在策划一个玛格南摄影展的时候,一共有四百张照片,跨越四十年。我意识到,以大约百分之一秒的快门速度计算,那四百张照片加起来也只有四秒钟的历史:每十年一秒。太少了。图说和其他形式的语境,对于一张仅仅代表几分之一秒的照片来说至关重要。
你可以在网站上找到我们几年前创建的《原则声明》(Statement of Principles)。这旨在成为一个国际运动,提升新闻和纪实摄影的可信度。基本前提是,艺术家可以用照片做任何他们想做的事,但在以新闻和纪实的方式再现真实事件和真实人物时,我们需要做到透明、清晰、诚实和真实。
第三个想法是“四角项目”(Four Corners Project),这是我 2004 年、二十一年前在阿姆斯特丹世界新闻摄影大赛(World Press Photo)的一次主旨演讲中提出的。网上每张照片的四个角落都可以承载特定类型的信息。这个项目旨在增强视觉媒体中的作者身份和可信度。
右下角记录作者信息:图说、署名、版权或知识共享许可证(Creative Commons license)、摄影师的伦理准则,以及指向机构或网站的链接。左下角提供背景故事(backstory):拍摄照片时正在发生什么。左上角是相关影像、视频或照片,也许是同一事件的不同视角。右上角链接到有更多信息的网站。

这里,右下角是摄影师的名字、图说和版权。我写了一份示范性的伦理准则来展示这个想法:虽然摄影是阐释性的,但作为摄影记者,我的照片旨在尊重我所描绘情境中的可见事实。我不在照片中增添元素,也不从中删除元素。
背景故事部分,我引用了那位摄影师的话。她说,不幸的是,她见过很多尸体,但看到这个男孩,阿兰·库尔迪(Alan Kurdi),让她做噩梦,感觉非常难受。不过她也欣慰,因为她帮助改变了我们看待欧洲移民问题的方式,让更少的人不得不在逃离战争时死去。
左上角展示的是阿兰·库尔迪和他兄弟生前的照片。不幸的是,两人都去世了。相关影像提供了更多语境。右上角链接到进一步的讨论,包括人权观察(Human Rights Watch)为什么认为发表一张死去儿童的照片是合适的,尽管他们通常不这样做。

你可以在 fourcornersproject.org 上看到这些不同的角落,也可以自己制作。我写了一些伦理准则范例,比如“我是时尚摄影师,我不与体重过轻的模特合作”,或者“我是艺术家,我可以做任何我想做的事”。我鼓励每个人在自己的网站上用一两句话写下自己的伦理准则,让人们了解你作为摄影师的态度。这个网站大约有八到十种语言版本,包括中文。
这张影像来自美国入侵海地。有了四角项目,你可以看到从侧面拍到的场景是什么样的,跟只看这一张照片非常不同。另一个例子涉及年轻的非裔美国人,他们担心如果自己被警察杀害,媒体会使用一张“黑帮分子”形象的照片。这个项目允许展示同一个人的另一张照片。人们可以被以很多不同的方式呈现。四角项目允许对同一个人进行多视角的呈现。


最后,如果大家有兴趣,我的网站 thefifthcorner.org 上有很多这些想法。我也在 Substack 上每周写一到两篇文章讨论这些问题。
讨论:真实、虚构与感知
藏策
非常感谢里钦先生刚才精彩的讲座,我听了之后也是非常受益。您一开始回顾了 Photoshop 和 AI 来临之前那些造假的照片,这让我想到以前看过的一个展览,里面完全用传统手法,用拼贴、涂抹和暗房技术,做出各种假的新闻照片,我觉得也非常有意思。
今天进入 AI 时代,只能说造假的手段发生了一个从量到质的非常大的变化,但造假的驱动实际上很早就有了。
我对 AI 影像也有很长时间的深入思考。您后面举的很多例子,其中有一点恰恰非常有意思:指令与召唤出来的影像,再现了以往传统照片与语言之间那种既互补又断裂的张力关系。也就是说,你发出一个指令,却不能完全预感到 AI 给你的回应、给你生成的影像是什么样子。这恰恰是我思考 AI 影像时一个非常重要的切入点,一会儿我会讲。
我又临时想到一个特别有趣的问题。我看过迈克尔·弗雷德(Michael Fried)的一篇文章,是分析罗兰·巴特(Roland Barthes)的《明室》(Camera Lucida)的。他讲到了照片的“刺点”,说 AI 合成影像将不再有刺点,因为它的指示性已经消失,不再指向现实的对象。
我觉得这个说法有道理,但我不会这样下结论,因为问题可能更复杂。合成影像不再指向现实中的某个物、某个细节、某个情境,但我认为它指向了梦。我们的梦有没有刺点?虚构的东西里面是不是也有?
刚才在里钦先生的影像中,我就看到了 AI 对指令的回应里那些让我们很惊讶的地方,甚至能从某些影像中看到所谓的刺点:象征界破裂,黑洞敞开。AI 合成影像确实指向不了一个现实的现有存在物,但仍然可以指向梦的刺点。一会儿我会详细说。
里钦(回应藏策)
完全同意。但我也要回头说一句,照片不是现实。它是对真实的一种再现、一种阐释,不是现实本身。照片往往也部分是幻想。有时候一部小说比一篇新闻报道更真实;虚构比非虚构更真实。在某些方面,AI 可以比照片本身更真实,尽管它不是对可见事物的记录。
我理解你的意思。人们误解了 AI 影像。他们看到的是最平庸的那些。我估计你在网上看到的百分之九十到九十五的 AI 影像都是无聊的、没什么意思的。我一直在试图用 AI 突破边界。你说尺度的问题,完全说对了。马歇尔·麦克卢汉(Marshall McLuhan)也说过类似的话:尺度上的差异。篡改和扭曲一直存在,不管是有意还是无意的,但现在尺度如此之大,我认为(用一个简略的说法)虚假已经变得比真实更重要了。
AI 生成的影像、视频、模拟的照片、编造物,比对可见事物的描绘拥有更多的社会流通性。可见之物在人们看来太普通、太琐碎了;他们不信它。它没有可信度。越来越多地主导媒体的是 AI、编造物、有意为之的虚假。就像翁贝托·埃科(Umberto Eco)在《走入超真实》(Travels in Hyperreality)里说的:虚假变得比真实更真实。不过我同意你的观点。
藏策
我们现在先有请陈国森博士,对里钦刚才的讲座给予回应。好,有请国森。
陈国森
感谢藏策老师主持,也非常感谢弗雷德·里钦先生的演讲。内容非常详尽,给了我很多启发。我大概用八到十分钟来做一个回应,最后提一个问题。其实我想讨论的远比我现在能说的多得多。
我想从另一个角度来切入 AIGC 影像的真实性问题。您用非常充分、令人信服的证据表明,在摄影与真实的关系史上,在摄影的真实性声称(truth claim)的历史中,连续性远比我们通常认为的要多。这个过程并不是从模拟到数字一刀切断,再从数字到 AIGC 又一刀切断。照片从来没有自动拥有过证据力。
即便一张影像的内容并非像传统纪实摄影那样直接来自现实,它所产生的效果仍然可以让人感觉极其真实,正如您刚才提到的,有时候甚至更加真实。这就让事情变得更复杂了。简单地把 AIGC 影像称为虚假的,并不能让我们走多远。就像我们在深度伪造和类似案例中看到的那样,即使我们知道一张影像是假的、是 AI 生成的,它仍然可以对当事人造成非常真实的伤害和后果,因为我们的视觉经验是被一个漫长的传统所塑造的。
正如布尔迪厄(Bourdieu)可能指出过的,没有什么比摄影更受规范和惯例的形塑了。但这些惯例不仅仅来自艺术史、摄影史或图像志(iconographic)的解释。它们根植于更广泛的社会现实,用您的说法,就是我们所有人共同生活于其中的共享现实。即使我们能辨认出 AI 生成的痕迹,我们也不能简单地否认这些影像所邀请的政治性、个人性或情感性的投射。那些投射的真实性不能被一笔勾销。
这就是为什么 AIGC 影像的真实效应(truth effect)值得被严肃对待和分析。最近一个案例可以说明这一点。在教皇选举期间,特朗普在 X 上发了一张 AI 生成的影像,把自己打扮成教皇。每个人都知道那是假的,但这并不能抵消它的政治和宗教效应。
还有一个相关的现象,也许不直接涉及政治。在中国的社交媒体上,有一种流行的玩法,提示词专门要求 AI 制作低画质的、不完美的或者模糊的照片。讽刺的是,结果反而看起来非常逼真。我们看到各种不可能的影像:希特勒和斯大林在上海东方明珠塔前合影,某人准备演唱会前的虚构自拍,或者斯大林和罗斯福在上海外滩合影这样的“历史人物照”。这些明显是假的,但人们仍然乐于制作和分享。
这就引出了我的问题:我们今天应该怎样理解 AIGC 影像与政治运作之间的关系?特朗普扮成教皇的影像似乎是一个典型的例子,虽然我对美国政治的细节不是特别熟悉。同样,中国的官方新闻媒体有时也使用 AIGC 影像来塑造某个群体的身份认同。毫无疑问它们是 AI 生成的,但仍然发挥着真实的政治功能。我们应该怎样看待这类人人一眼就能认出是 AI 生成的影像?这就是我想问的。谢谢。
里钦
谢谢你的评论。你说得完全对。我 1990 年那本书叫《以我们自己的影像》,因为数字软件将允许我们按自己希望的样子重塑世界,而不是按世界本来的样子。某种程度上,我把这看作消费资本主义。作为消费者,你想要得到你想要的东西。你几乎成了一个小神:经济和社会结构的设置,至少是在假装给你你想要的东西。AI 允许你按照自己的影像重塑世界。
生活和社会有那么多困难,这就变成了一种小小的胜利:“按我的方式来。世界就是我的方式。”面对所有挑战和复杂性,像特朗普这样的人绕过了摄影,宣称虚假比真实更重要。权力在虚假那里。他不再需要顺从现实;他可以编造自己的现实。在这个意义上他成了一个蛊惑者(demagogue)。我们正在许多社会中看到蛊惑者的壮大,而 AI 加速了这个过程,支持并赋予了他们的愿景以视觉形式。
上周五我在 Substack 专栏里问 AI,哪些照片最能质疑特朗普政府的施政智慧,最能说明它做得不好。ChatGPT 给出了三张影像。两张是 AI 的:你提到的那张教皇影像,和一张他扮成国王的。第三张是他的官方肖像,模仿了他那张嫌疑人照片。
让我震惊的是,AI 没有推荐任何一张加沙、乌克兰、饥饿或疾病的照片。没有一张是关于这个世界的照片。全是关于虚假的,而虚假比真实拥有更大的权力。这才是巨大的恐惧。你提出了非常重要的问题,我们可以再花一个小时来讨论。我们怎么应对?媒体生态系统已经发生了巨大的变化。这不仅仅是 AI 对摄影的问题,而是真实与真切对抗编造和虚假的问题。这是全球性的危险和挑战。整个媒体生态系统正在快速变化,AI 正在取代照片。
如果我想看 1830 年的中国或 1920 年的巴黎,它会按我想要的方式生成影像。就像快餐店:你要什么?多加酸黄瓜?多加番茄酱?给你。AI 把世界变成你想要的样子,而蛊惑者利用这一点来增强权力。这是一个巨大的问题集合。你说得对,但我们需要再花一两个小时才够讨论。
陈国森
我明白了。谢谢。
里钦
最后一句:一个简单的说法是,我们从自画像(self-portrait)走向了自拍(selfie),再走向虚拟化身(avatar)。
江融
弗雷德,如果可以的话,你走之前我能问两个简短的问题吗?非常简短,你甚至可以只回答“是”或“不是”。
里钦
请说。
江融
我的第一个问题是关于 AI 是不是摄影。十多年前我采访你的时候,你说数码摄影是一次范式转换(paradigm shift)。你把它叫作“摄影之后”,或者“超级摄影”(super-photography),或者像很多人说的“摄影 2.0”。现在我们有了 AI 生成的影像。我们知道它们不完全是摄影,但既然摄影是如此有可塑性的,我们能不能把它叫作“摄影 3.0”?它也算一种摄影吗?
里钦
我认为它是一种不同的媒介。它不是摄影;它是一次范式转换。完整的回答更长,但对于计算摄影,我们可以讨论它到底是摄影还是只是成像。至于 AI 生成的影像,那肯定不是摄影。有时候它看起来像照片,有时候像绘画,有时候听起来像音乐。但它不是摄影。
江融
我的第二个问题是这样的:你展示了 AI 生成的关于过去和未来的影像,但我觉得 AI 很难生成人类当下的直接体验。所以我认为,至少到目前为止,AI 能生成的东西不会真的像人类摄影师创作的纪实摄影那样真实。你同意吗?
里钦
不同意,因为我觉得你太理想主义、太乐观了。我上周给你们看的那些自画像就是我做的。你想做什么就能做什么。你可以模拟照片;我做过关于乌克兰战争和加沙的影像。AI 的逼真度现在已经非常高了。如果你给我看十张影像,问哪些是 AI、哪些是照片,在这个领域工作了五十年之后,我通常大约能答对七张。它可以做当下,可以做未来,也可以做过去。
但我不认为那是它将来真正要做的事。我认为它会做比模拟照片重要得多的事情:探索我们不了解的行星,微观层面的东西,或者几千年前的历史。作为超出摄影参数之外的探索工具,它会非常有意思。我们才刚刚开始。在很多方面,摄影一开始是在重复绘画,而 AI 一开始是在重复摄影。
在未来几年里,它会变成一种更广阔、更复杂、更细腻的媒介,帮助我们以不同的方式理解自身。比如,用 AI 你可以描绘梦境或噩梦,这是摄影做不到的。你可以输入“我梦到了……”作为提示词。一个受过创伤的人,一个孩子,也可以这样做。在与无意识的关系方面,AI 可能非常有意思。
还有很多可以讨论的。我很乐意再来聊两个小时。今天的目的是为一些想法打个基础。非常感谢大家。和你们交流我很高兴,希望对大家有帮助。你们可以通过邮件联系我,我很愿意再来。理想的话,有一天我到中国去,我们面对面做这个讨论。
江融
是的,我也正是这么想的,把你请到中国来面对面交流。非常感谢你的时间和演讲,弗雷德。
里钦
谢谢大家。也谢谢翻译。
藏策
实际上,现在讨论才进入到更烧脑的阶段,是吧?下面先请江融老师分享一下 PPT,然后我再把这些年思考的一些观点分享一下,从更多元的思路和更深的层面,对里钦先生的讲座以及今天的讨论作一个回应。好,江融老师请。
江融:弗卢瑟与技术影像
江融
好,我想针对刚才里钦的演讲,跟大家分享一下。早在上世纪 80 年代,捷克出生、后来移居巴西的哲学家维莱姆·弗卢瑟(Vilém Flusser)就出版过两本书。一本是 1983 年的《摄影哲学的思考》(Towards a Philosophy of Photography),国内好像已经有译本了。这本书以摄影作为起点,把相机视为一个“装置”,实际上就是器材,以装置为逻辑起点来谈他对摄影的哲学思考。
更重要的一本专著,是 1985 年以德文出版、2011 年才出英文版的《技术图像的宇宙》(Into the Universe of Technical Images),国内复旦大学出版社也已经有中文译本。我觉得更准确的译法应该是“朝向”,或者说“进入技术影像的宇宙”。在这本书里,他更系统地讲了“技术影像”这个概念。
什么叫技术影像?根据弗卢瑟的定义,它区别于传统影像。请注意,他用的是 image,不是 picture。他把绘画视为传统影像,说五千多年前,人类在洞穴里开始绘画,后来慢慢有了语言,语言成为交流的主要媒介;再后来有了摄影,摄影之后又有了数码摄影。
刚才里钦也说,起初是光学摄影,第二步是计算摄影,也就是通过数字来合成影像,到了现在,已经可以不用镜头、不用相机,用 AI 软件就能合成影像。弗卢瑟在 80 年代写作时,就已经有电脑合成的影像。那时数码相机还没有商业化生产,我记得是 1989 年出来的,但在此之前已经有数字合成的影像,包括电脑合成的影像。他把这些统称为“技术影像”,不是“技术图像”,英文叫 technical images。
技术影像是从相机、计算机这样的装置及其软件中,通过计算抽象出来的影像,往往像由颗粒拼成的镶嵌画,比方说像素。它使现实模型化,并不直接再现现实。光学影像用底片和镜头拍摄,是直接再现现实;到了数码影像,它已经是计算机抽象出来的影像,与绘画这样的传统影像以及文本区分开了。弗卢瑟认为,人类今后会越来越多地用技术影像来交流。
这会产生什么特征?技术影像并非像传统影像那样,是观察外部世界的事物所产生的结果,它是对不同概念进行计算的结果,通过内部程序和算法产生影像。它与外部世界没有直接关联,虽然看上去好像来自外部世界。
从这一点来说,可能可以印证里钦刚才的回答:AI 生成的影像不能算摄影。为什么?因为摄影最重要的一个特征,是它与现实世界有直接关联,这也是摄影媒介与绘画等其他媒介最大的区别。AI 影像没有这种直接关联,不是直接再现,虽然它可能模仿得很像,看上去好像直接来自现实世界,但它已经是一个新媒介。所以弗卢瑟其实是一个预言家。哲学家往往不仅总结现实世界的规律,也能够作出预测,这是他们的伟大之处。
相对于传统影像,以及作为线性符号的文本,弗卢瑟把技术影像看作第五级的抽象。在《技术图像的宇宙》英文版的附录四里,他把人类的抽象过程分为五级,讲到早期洞穴中对动物的绘画,一直到今天这样的技术影像。他认为技术影像是从科学文本中派生出来的,掩盖了符号的本质。
弗卢瑟认为,技术影像带来了一种历史性转变。我们原来生活在文本的宇宙中,用文字、字母进行线性的沟通,现在进入了用影像沟通的世界,一种多维的,甚至没有维度的世界。他认为技术影像没有维度,这一点令人思考。
如果说传统影像是关于历史的影像,那么技术影像主导着后历史时代。过去讲述历史,是用文字作线性描述,现在可以全方位地描述未来、过去、当下,也可以描述梦。我们进入了后历史时代,技术影像可以对现实进行中介。
这会产生一种危机:技术影像的泛滥可能使人类陷入影像拜物教,混淆符号与现实。人们成天看到大量影像,不仅可能对网红的影像顶礼膜拜,也可能崇拜刚才提到的特朗普把自己化身为教皇的那种影像。当然,也有很多人批评它。我们开始分不清什么是真的、什么是假的,这是比较悲观的一面。
它甚至可能造成集权式的同质化,比如通过监控影像来监控社会。弗卢瑟在当时就已经预见了这种可能性。但他也提到乐观的一面:如果人类能够主动解码程序,技术影像也可以成为对话性的媒介,激发创造性的参与,比如数字艺术、开源代码的影像等等。
所以技术影像是双刃剑,就像一把刀,可以切菜,也可以杀人。它可能造成影像拜物教、集权式的同质化和以假乱真的后果;如果使用得当,艺术家也可以把它当作新的创作媒介。
当下更重要的哲学任务,是建立影像现象学。我个人认为,埃尔温·潘诺夫斯基(Erwin Panofsky)提出图像学时,还没能预见今天这样的技术影像。国内很多朋友现在还在用“图像”这个词,我觉得应该改成“影像”。
AI 生成的绝对是影像,千万不要说是图像,虽然它看上去可能像绘画。绘画的图像,英文叫 picture,通常是画出来的;技术影像是生成的。除非你把它打印成照片,拿在手里,否则它在数码相机的传感器里、在电脑里、在 AI 软件里,其实就是一些数据、代码或词元(token)。它不像传统模拟影像或者绘画,所以应该叫影像。请大家记住。
我们需要建立新的影像现象学,揭示技术影像的建构性,同时对抗它的幻觉力(hallucinatory power)。这个词,弗卢瑟早就在书里提到了。他的理论既警告人们不要被动消费影像,也强调人类应该重新扮演“幻想者”(visionary),把 AI 变成工具,主动使用它。
如果能这样做,技术影像仍然具有解放的潜力,能够解放我们的思维和想象力。所以弗卢瑟在上世纪 80 年代关于技术影像的著作,对于媒体研究、数字文化以及人工智能生成影像的批判,至今仍然非常重要。
我就分享到这里。谢谢主持人,谢谢弗雷德·里钦今天精彩的演讲,也感谢国森老师的参与,以及后台各位老师提供的支持。现在把话筒交回主持人藏策。
藏策:AI 影像与人的感知
藏策
好,谢谢江融老师。我也尽量简短地说一下这些年对 AI 影像的思考。
我们思考 AI 合成影像时,首先遇到的是真实与虚构的问题。但在讨论之前,有一个大前提:从神经科学来讲,人类意识本身就是虚构的。我们实际上看不到真正的物理世界,而且我们与世界也不是主观和客观的二元对立关系,因为我们就置身于世界之中。我们看到的世界,是人类生活在世界之中、与世界沟通的一种模型,或者更简单地说,是一种界面,这个界面建立在人的感知系统之上。
以前我们说语言是人类世界的边界,但从今天神经科学的新研究来看,这个说法好像有些片面。严格讲,语言只是模型的一部分,是界面的一个重要组成部分,并非全部。所谓真实,首先是基于人类感知的真实。对于物理世界的真实,我们只能以自己的感知方式,感受它的某一个侧面、某一种表象。越是去看,它实际上越是在不断后撤,用哲学的说法,就是物在不断后撤。
人关于世界的感知模型是怎么建立的?人的大脑本身就是一个制图系统,首先是为了让人在所处环境中有效生存,维系内稳态和意识的连续性。大脑先生成一个认知地图,再加上行为目的、概念乃至语义,就生成了所谓的“图式”。这个概念以前属于心理学,今天也进入了神经科学领域。
比如国森要去机场接待一个人,脑子里马上就有一个图式:先下楼,坐哪个车,目的是什么,到了机场又该怎样。他有这样一套行动方式,这就是图式。这些东西不断完善着人类行为和思维的模型。我们谈影像或其他图像,包括江老师刚才说的绘画,都以此为必要前提。
强调了这个前提,再具体来说,以往用直接摄影方式得到的影像,到底有没有真实性?更具体一点,以前强调的纪实影像,到底有没有真实性?如果有,真实性在哪里?经过长时间思考,我个人认为,传统摄影影像中有两点可以视为真实。
第一点是光波。被摄物体表象的反射光,与胶片感光材料之间,形成了物与物之间物理信号的传递,这个传递是真实的,就像阳光照到植物上形成光合作用一样真实。这种物理过程不受人的意愿支配。
第二点涉及摄影师:他拍照时,身体处在什么空间位置,尤其是他的目光。我给它起了一个概念,叫“目光的注册”。你的目光、你的意向性看向哪里?你关注了哪里?你的注意力、视觉焦点落在现实空间中的某物、某处。你的视点就是你的立场、你的观点,也是意向性所在,你看到的地方是意向的相关项,这也是真实的。即使你拍一张假照片,目光投注在造假的地方,也揭示了这个目光的虚伪,而这种揭示本身仍然真实。
我说的真实是这两点。以前纪实摄影所说的真实,也就是影像承载和传递的、观众从中解读的意义,恰恰是虚构的。为什么?因为影像只有指示性,它并非事物本身,没有得到充分的充实。
具体到新闻摄影,就以刚才里钦讲座中的例子,黄功吾(Nick Ut)拍摄的那张照片来说。现在连照片是不是他拍的都有争议,荷赛也已把作者署名暂时搁置,究竟是谁还有待确认。你想,连这个都未必确定,照片又怎么能够还原现场事件的真实性?它提供了某一次“目光的注册”,怎么能还原事件本身的真实?所以,以前我们认为纪实影像表达的那种真实,在我看来恰恰是虚构的。
那么,为什么这张照片影响这么大,为什么大家都认为它真实?它像创伤时刻的闪回,植入看照片的媒体受众的记忆之中,像一个楔子,唤起每个人不同的创伤性记忆。小女孩裸露的身体,就像象征界在此刻被撕开了一道裂口,带来一种刺痛,一种创伤时刻的闪回,所以大家的印象非常深。
里钦刚才提到,江融兄以前好像也讲过,为什么这样的新闻照片越来越少,后来乃至消失?恰恰是因为这样的创伤时刻,正在被另外一些东西淹没。
再具体到 AI 合成影像,我有很多思考,今天时间不够,只讲几个要点。这种技术影像并非自然生成,它依靠统计算法,是概率生成的。就像刚才说的刺点,它不再具有指向现实某处、某物的指示性,而是进入了一种算法关系。指令与合成影像之间,又以另一种方式呈现了以往语言与图像的关系。
有意思的是,语言在这里分叉了,变成数据语言和感知性语言。包括文学在内,能够被人的感知系统感受、起作用的,是感知语言,和传统语言一样。但别忘了,生成它的背后还有数据语言。刚才江融老师也提到,弗卢瑟讲过,如果要掌控它,你也要成为能够创作数据语言的人,才能有效地采取主动。
那么,知觉语言与数据语言是什么关系?我认为,数据语言是知觉语言的代码,而知觉语言是数据语言的什么?用现象学的话说,叫“奠基”。就像科学世界由生活世界奠基一样,知觉语言为数据语言奠基。
江融
奠基,对。
藏策
比照传统影像,合成影像源于海量图库,通过算法生成,而算法本身并不透明。所以,原来摄影师的“目光的注册”,在这里不再投注于现实的某处,它指向了什么?指向由数据构成的影像海洋。我为什么提到梦,依据就在这里。
我们每天眼睛看到的东西非常多,但绝大部分根本没有进入意识。它作为一种瞬间意识,被大脑为了维持内稳态而剪除。只有那些留下印象的才报告给意识,叫可报告意识;大量没有报告给意识的东西,变成碎片储存在神经元里。这些东西没有消失,梦就是这样来的:它们在梦里,在所谓自我参照的驱动下,重新组合成各种奇异的梦境。
这让我想到一个很有趣的问题,就是快照。为什么那些特别不经意的快照会让我们觉得奇妙?比如肖尔,就非常善于利用快照。它恰恰相当于瞬间意识:我们平常没注意到、没进入意识报告的东西,一旦成为照片,就通过照片报告给了意识。而且它不再是转瞬即逝、可以忽略的印象,而是被技术持存,可以长久地反复观看、把玩,那些不经意的细节也都展开了。这会给我们的感知带来非常奇妙的效果。
影像海洋中被指令召唤出来的合成影像,也会偶发地出现这样的东西。指令不能彻底控制合成影像,生成的影像与指令之间会出现断裂和张力,出现让你意想不到的东西。这是非常有意思的现象。
这就是我刚才说的另一种刺点。里钦先生展示的合成影像中,也有让我们惊异的地方。什么叫刺点?就是没有被象征秩序捕获的东西,一种断裂,忽然间出现一个断口,让我们惊异;或者它勾起某种瞬间意识的闪现,激活大脑里那些瞬间意识。
那梦到底真实不真实?梦肯定是虚幻的。但为什么那么多精神分析学家,为什么从古代到今天,人们这么重视梦?梦里没有真实性,却可能生成真理性。荣格(Carl Gustav Jung)、弗洛伊德(Sigmund Freud)、拉康(Jacques Lacan)都重视它,解梦就是为了在虚构的梦里发现真理性。
所以,我对 AI 时代影像的思考,挑重点来说,一个是 AI 不仅改变现实,或者用拉康的术语说,不仅改变象征界,更改变人类的感知方式。对于摄影而言,它以统计学代替了指示性。哲学家陈嘉映曾经说过,他不认为 AI 会越来越像人类,反倒是人类会越来越像 AI。AI 改变人的感知系统,人被 AI 带着走。
大语言模型给我的另一个很大启发,是转喻性。在艺术创作和文学写作中,转喻的重要性实际上大于隐喻。它不沿着纵向的、德勒兹(Gilles Deleuze)所说的树形结构,从概念往下走。转喻链,也就是能指链上的滑动,带来各种新奇的东西,这种组合本身就会生成意义。意义并非直接从上面落下来,它生成于不同事物的奇妙组合之中。
AI 给我们作了一个最好的证明:它根本不懂自己在说什么,却仍然能够生成在我们看来非常好,甚至比人写得还好的文本,完全能够欺骗你。这说明横向转喻的组合性非常重要。
还有一个问题:传统的直接摄影方式,特指当代摄影中采用直接摄影的方法,在 AI 时代是否会失效?这个问题很大,我不展开。因为在 AI 时代,我们面对的不仅是对象,还有超对象。超对象是不可见的,或者是我们见不全的东西,不再是站在这里就能直接看到、然后通过指示性或暗喻指向它的对象。超对象会越来越多,AI 本身也是超对象。
还有一个非常重要的观点:在 AI 时代,与其说捍卫真相,不如说更重要的是捍卫人类的感知,属人的感知。我们的身体性、具身性,恰恰不能被 AI 替代。作为人类,今天应该捍卫感知。如果连感知都变了,还谈何真相?所有真相都建立在人类感知系统之上,是感知的真实;如果感知都捍卫不了,真相就无从谈起。
关于真相再简单说一句:何为真相,实际上由“真相机制”确认。以前说“眼见为实”“有图有真相”,认为摄影一定比绘画真,因为一个是手画的,一个是机器自动生成的。什么叫真相机制?就是我们把真相认定为真相的那种机制,这也是值得思考的问题。
最后,刚才里钦一再提到摄影不等于真实,那么在 AI 合成影像里,我们还能不能有新的可能性?我觉得既应警惕,也应有所乐观。这种乐观不能只是躺平,等着乐见其成,我们需要主动对待这件事,思考如何在 AI 时代继续生成主体性。
AI 会成为一个大他者吗?会成为一个新的大他者。我们要意识到它的存在,也不能躺平。包括弗卢瑟讲的,要掌控技术和数据语言;比如今天出现的故障艺术,针对 AI,让它内爆,这也是一种主动的方式。我就不详细展开了。
今天大概说到这里。江融老师有什么简单的反馈吗?
江融
我觉得今天讲得非常好,与里钦的演讲、我刚才介绍的弗卢瑟技术影像理论,以及国森老师讲的感受和问题,都是相关的。今天是一个很好的机会,能和大家一起分享这些思考。
藏策
谢谢。今天摄影界面对 AI 时代有各种各样的观点,大部分人相对还比较迷茫,也有很多人不断思考这个问题。所以我觉得今天的讲座非常重要,像这样的话题,以后还会继续讨论。时间已经很晚了,谢谢各位嘉宾,也谢谢观看节目的观众,今天的分享就到这里。
结束报幕
感谢各位老师的精彩分享,也感谢大家用心聆听。服务器艺术“当代影像,路径及其可能”第十三期“摄影在 AI 时代的转型”线上论坛圆满结束。感谢各院校、机构和媒体的大力支持与参与,我们期待下次再见。谢谢!

