撰文:Techub News 整理
导语
近日,前特斯拉AI总监、OpenAI创始成员Andrej Karpathy(安德烈·卡帕西)在一场面向学生和行业新人的演讲中,分享了他对AI浪潮下软件根本性变革的思考。作为深度参与自动驾驶和前沿AI研究的资深专家,Karpathy的视角兼具技术深度与历史纵深感。他认为,我们正处在软件范式70年未遇的剧变之中,这不仅重塑着开发工具与基础设施,更在重新定义“编程”本身以及人机协作的方式。本次演讲系统梳理了从Software 1.0到3.0的演进,并展望了构建下一代AI原生应用与生态的关键挑战与机遇。
摘要
- 软件正经历第三次根本性范式迁移:从代码(1.0)到神经网络权重(2.0),再到用自然语言提示编程大语言模型(3.0)。
- 大语言模型(LLM)可被视为一种新的“计算机”或“操作系统”,其生态发展类似1960年代的早期计算,目前主要通过云端分时共享。
- LLM是具备“人类心理”但又有认知缺陷的“人魂”,与之高效协作需构建具备“自主性滑块”、定制GUI和快速“生成-验证”循环的“部分自主”应用。
- 自然语言编程(如“氛围编码”)极大降低了软件构建门槛,同时,为AI智能体优化数字基础设施(如LLM友好的文档、协议)是巨大的新机遇。
- AI代理的完全自主之路将比预期漫长,应优先构建人类监督下的增强工具(“钢铁侠战衣”),而非完全自主的代理。
软件的三次范式革命:从代码到权重再到提示
Andrej Karpathy(安德烈·卡帕西)开篇即指出,现在进入科技行业是一个“极其独特而有趣”的时机,根本原因在于“软件正在再次发生改变”。他回顾了软件发展的历史范式:
Software 1.0 即我们熟知的传统计算机代码,是人类编写的、精确的指令集合,用于命令计算机执行任务。GitHub是其代码库的典型代表。
Software 2.0 这一概念由Karpathy数年前提出,指的是神经网络的权重(weights)。程序员不再直接编写逻辑,而是通过准备数据集和运行优化器来“间接编程”,生成网络的参数。Hugging Face等平台可视为Software 2.0的“GitHub”。例如,图像生成模型Stable Diffusion的巨大参数集,以及在其基础上微调产生的各种变体,都可视作这个空间中的“提交记录”。
然而,直到最近,大多数神经网络都还是“固定功能计算机”,如图像分类器。真正的变革在于:大语言模型(LLM)让神经网络变得可编程了。Karpathy认为这值得被称为 Software 3.0。在3.0范式中,提示(Prompt)就是程序,它用自然语言(如英语)编写,用来“编程”LLM这个新型计算机。他曾在推特上感慨:“引人注目的是,我们现在正在用英语编程计算机。”这彻底改变了编程的准入门槛和表现形式。
他以情感分类任务为例:在1.0范式下,需要编写Python代码来定义规则;在2.0范式下,需要训练一个专门的神经网络;而在3.0范式下,只需设计一个包含少量示例的提示给LLM即可。如今,GitHub上的代码仓库里已经大量出现夹杂着英语注释的代码,这正是一种新编程范式崛起的迹象。
Karpathy以在特斯拉开发自动驾驶(Autopilot)的经历为例,生动说明了范式迁移的力量。最初,Autopilot堆栈中包含大量C++代码(Software 1.0)和一些用于视觉识别的神经网络(Software 2.0)。随着系统进化,神经网络的能力和规模不断增长,而许多原本由C++实现的复杂功能(如多摄像头图像信息跨时空融合)被神经网络取代,导致大量1.0代码被删除。Software 2.0“吞噬”了软件栈。他预见,同样的过程将在Software 3.0中重演。
因此,对于开发者而言,精通这三种范式至关重要。每种范式各有优劣,开发者需要根据具体功能需求,决策是使用传统代码、训练专用模型,还是直接提示LLM,并能灵活地在不同范式间切换。
LLM:新“操作系统”、新“计算机”与新“公共事业”
那么,如何理解LLM这种新事物?Karpathy提出了几个精妙的类比框架。
首先,LLM类似于“公共事业”(Utility)。正如Andrew Ng(吴恩达)所说“AI是新电力”,LLM实验室(如OpenAI、Google、Anthropic)投入巨资训练模型,类似于建设电网;通过API提供智能服务则相当于运营电网,按量(每百万token)计费。用户对其有类似公共事业的需求:低延迟、高可用性、质量稳定。甚至当顶级LLM服务中断时,会引发全球范围内的“智能降压”——世界会暂时“变笨”。
其次,由于训练LLM所需的资本支出(Capex)极高,且技术迭代快速,核心研发能力集中在少数实验室,因此它也有点像半导体制造厂(Fab)。使用NVIDIA GPU训练如同“无晶圆厂(Fabless)”模式,而像Google这样自研TPU并训练,则类似英特尔拥有自家晶圆厂的模式。
但Karpathy认为,最贴切的类比是将LLM视为“操作系统”。它不仅仅是电力或水那样的同质化商品,而是日益复杂的软件生态系统。当前格局与操作系统市场惊人相似:存在少数闭源提供商(如GPT、Claude、Gemini系列,对应Windows、macOS),以及一个正在崛起的开源替代品(Llama生态系统,对应Linux)。
他将LLM本身比作新型计算机的“CPU”,上下文窗口是“内存”,而LLM协调内存和计算资源来解决问题,并整合工具使用、多模态等功能——这完全是一个操作系统的架构。许多应用(如代码编辑器Cursor)可以在不同的LLM(GPT、Claude等)上运行,就像VS Code可以在Windows、Linux、macOS上运行一样,只需在下拉菜单中选择。
我们正处在类似于1960年代的“分时计算”早期阶段。LLM计算仍然昂贵,被迫集中在云端,用户通过网络以“客户端”形式交互,无法独占整机,因此采用分时共享是经济的。真正的“个人计算革命”尚未到来,但已有迹象(如在Mac Mini上本地运行某些LLM)。目前,我们主要通过文本终端(如ChatGPT的聊天界面)与这个“操作系统”交互,一个普适的图形用户界面(GUI)尚未出现。
Karpathy特别指出LLM一个“史无前例”的特性:技术扩散方向是“颠倒”的。通常,电力、加密技术、早期计算机等 transformative 技术总是先由政府、军方或大公司采用,之后才扩散至消费者。但LLM却反其道而行之:最先普及的应用是“如何煮鸡蛋”这类日常生活问题,普通消费者走在了前面,而企业和政府机构在采用上反而滞后。这是因为LLM是软件,可以瞬间通过互联网部署到全球数十亿设备上,这种普及速度和模式是前所未有的。
与“人魂”共舞:LLM的心理学与协作方法论
要有效编程LLM(Software 3.0),必须先理解它是什么。Karpathy喜欢将LLM视为“人魂”(People Spirits)——一种基于自回归Transformer的、对人类文本的随机模拟器。因为它训练于人类产生的海量文本,所以涌现出了类人的心理特质,但同时也有显著的认知缺陷。
其“超能力”包括:百科全书式的知识和记忆(堪比电影《雨人》中的自闭症学者),远超任何个人类个体。
其“认知缺陷”则包括:
- 幻觉(Hallucination):会编造事实,对自身知识的边界认识不足。
- 锯齿状智能(Jagged Intelligence):在某些领域表现超人类,却在另一些简单问题上犯低级错误(如坚持认为9.11大于9.9,或说“strawberry”有两个‘r’)。
- 逆向性遗忘(Anterograde Amnesia):不像人类同事能通过睡眠巩固记忆、积累专业知识。LLM的“权重”是固定的,“上下文窗口”只是其工作记忆,每次对话后即被清空,类似于电影《记忆碎片》或《初恋50次》中的主角。如何让LLM持续学习仍是待解难题。
- 安全性问题:容易受提示注入攻击,可能泄露数据,过于轻信。
因此,与LLM协作的核心挑战在于:如何绕过其认知缺陷,同时充分利用其超能力。这引出了Karpathy认为当前最大的机会领域:构建“部分自主”(Partial Autonomy)的LLM应用。
以编程为例,直接使用ChatGPT复制粘贴代码效率低下。而像Cursor这样的专用应用则展示了LLM应用的理想形态:
- 自动化上下文管理:LLM自动处理文件嵌入、代码理解等。
- 多模型调用编排:协调聊天模型、代码补全模型、代码差异应用模型等。
- 应用特定GUI:这是关键。文本交互难以阅读和审计。GUI(如图形化显示代码差异)允许人类快速验证AI的工作,通过快捷键(Cmd+Y接受/Cmd+N拒绝)极大加速协作循环。
- 自主性滑块(Autonomy Slider):用户可控制AI的自主程度。在Cursor中,从Tab补全(低自主)、到修改选中代码块(中自主)、再到让AI自由修改整个仓库(高自主),用户可以根据任务复杂度灵活调整。
另一个例子是Perplexity AI,它也具备类似的特性:打包信息、编排多个LLM调用、提供可审计的引用来源GUI,以及从快速搜索到深度研究的不同自主级别。
Karpathy预测,大量软件将变得“部分自主”。关键在于:LLM能否看到人类能看到的一切?能否执行人类能执行的操作?人类能否有效监督并保持在循环中?因为当前的LLM仍是不完美的、易出错的系统。
他强调了加速“生成-验证”循环的重要性。人类与AI协作,通常是AI生成,人类验证。为了让这个循环更快:1. 加速验证:GUI至关重要。视觉信息处理是人类大脑的高速通道,阅读文本则费力得多。图形化表示(如图标、颜色编码的差异)能极大提升审计效率。2. 约束AI(Keep AI on a Leash):不要过度追求完全自主的智能体。让AI一次性生成10,000行代码的改动毫无意义,因为人类验证会成为瓶颈。我们需要控制AI的输出规模,使其保持在小而增量的、易于验证的范围内。
他分享了自己的AI辅助编码最佳实践:追求小而具体的任务,保持快速迭代循环,避免过大改动。模糊的提示会导致验证失败和循环卡顿,因此花时间构思更具体、精确的提示是值得的。
在教育领域,他构想将“教学”分解为两个应用:一个供教师创建标准化课程(可审计的中间产物),另一个供学生学习该课程。这样就将AI约束在预设的教学大纲和项目进度内,防止其“在森林中迷路”。
Karpathy以在特斯拉开发自动驾驶的经历警示,完全自主之路道阻且长。他早在2013年就体验过完美的无人驾驶演示,但12年过去,问题仍未完全解决,人类仍在循环中。因此,他对“2025年是智能体之年”的说法表示担忧,认为这将是“智能体的十年”,需要人类持续监督。他更推崇“钢铁侠战衣”的类比:战衣既是增强人能力的工具( augmentation),也具备一定自主性(agentic)。在当前LLM仍有缺陷的阶段,我们应更多构建增强人类能力的“战衣”(部分自主产品),而非完全自主的“机器人”。这些产品应有定制化的GUI/UX,旨在加速人机协作循环,但同时内置“自主性滑块”,为未来逐步提高自动化水平做好准备。
氛围编码、智能体与数字基础设施的重塑
Software 3.0的另一个革命性影响是:编程语言变成了自然语言(如英语)。这意味着几乎人人都成为了潜在的程序员,无需经过5-10年的专业学习。
Karpathy提出的“氛围编码(Vibe Coding)”概念在网络上引起了巨大共鸣。它描述了这样一种状态:开发者并非精确指定需求,而是通过感觉和迭代与LLM协作,快速构建出定制化原型。他分享了自己“氛围编码”的经历:在不懂Swift的情况下,一天内构建了一个基本的iOS应用;还创建了MenuGen.app,一个为餐厅菜单生成图片的应用(尽管目前是个“负收入”项目)。
然而,构建可用的原型(在本地运行)相对容易,而将其变成真正的产品(涉及身份验证、支付、部署等运维工作)则异常繁琐。这些工作往往不是写代码,而是在网页上点击各种配置。Karpathy对此感到沮丧:“计算机在告诉我应该点击哪里。为什么是‘我’在做这个?为什么不是‘你’(计算机)来做?”
这引出了演讲的最后一部分主题:我们能否直接为AI智能体(Agents)构建基础设施?
Karpathy指出,数字信息的消费者和操纵者出现了新类别:过去只有人类(通过GUI)和计算机(通过API),现在多了“人魂”式的AI智能体。我们需要调整数字世界以适应它们:
- LLM友好的文档:大量现有文档是为人类阅读设计的(包含列表、加粗、图片),LLM解析困难。应提供Markdown等LLM易于理解的格式。Vercel、Stripe等已开始提供LLM专用的API文档。
- 从“点击”到“cURL”:文档中的“点击此处”对LLM无效。Vercel正在将文档中的“点击”替换为等效的cURL命令,以便智能体直接执行。
- 专用协议:如Anthropic提出的“模型上下文协议”(Model Context Protocol),旨在为智能体提供标准化的交互方式。
- 便捷的数据摄取工具:例如,将GitHub仓库URL中的“github.com”替换为“git- ingest.com”,就能获得所有代码文件拼接而成的、适合直接粘贴给LLM的单一文本。还有工具能为代码库自动生成深度分析文档,更利于LLM理解。
虽然未来LLM可能学会点击和导航现有界面,但Karpathy认为,主动“与LLM在半路会合”,优化基础设施使其更容易访问信息,仍然是高性价比的做法,尤其对于大量不会主动适配的长尾软件。
结语:拥抱软件的新纪元
Andrej Karpathy(安德烈·卡帕西)总结道,现在进入科技行业是一个惊人的时机。我们需要重写海量代码,这些代码将由专业开发者和“氛围编码者”共同完成。
LLM既是公共事业,也像晶圆厂,但最核心的是——它们是处于1960年代早期阶段的“操作系统”。我们正在与之协作的对象,是这些既有超能力又有认知缺陷的“人魂”。为了高效协作,我们必须调整开发实践(构建部分自主应用、加速生成-验证循环、保持对AI的约束),并重塑数字基础设施以适配智能体。
回顾“钢铁侠战衣”的类比,未来十年我们将见证“自主性滑块”从左向右缓慢而坚定地移动。这是一个需要耐心、严谨和创造力的漫长过程,但无疑也是软件史上最激动人心的篇章之一。Karpathy最后表示:“我迫不及待地想与各位共同构建这个未来。”
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。