OpenAI刚刚又迎来了一次重大进化。备受瞩目的ChatGPT Sites正式开启公测。即便不懂一行代码,只需几段自然语言描述或上传一张草图,就能在十几分钟内生成一个高度专业且功能复杂的交互式网站。传统的建站SaaS行业正面临前所未有的颠覆。与此同时,底层技术侧也传来了惊人消息:GPT-6展现出了令人咋舌的跨模态能力。在无音频播放且完全断网的状态下,仅凭一张Mel频谱图,GPT-6便能识别出深海蓝鲸的叫声,甚至能分辨出《星球大战》中的光剑音效。这标志着AI的多模态理解已经彻底打破了人类的感官壁垒,它不再是笨拙地模仿人类的看与听,而是进化出了对物理世界数据结构的“原生解码”能力。
ChatGPT Sites公测:建站如写文档
曾几何时,拥有一流的个人网站是程序员和专业设计师的特权。后来,Dreamweaver应运而生;再后来,Wix、Squarespace乃至Tilda等拖拽式建站SaaS工具普及开来。但今天,ChatGPT Sites的公测直接将建站门槛彻底粉碎。知名科技媒体Fast Company以及Wonder Tools主理人Jeremy Caplan在实测后表示,ChatGPT Sites带来的体验极其颠覆:“现在,制作一个美观的网站就像创建一个Google Doc一样简单。”目前,该功能已向ChatGPT Plus、Pro、Business、Enterprise和Edu用户全面开放。
其运作过程简单至极。首先,描述你的愿景,用几句话写下想要的网站类型和目标受众;其次,喂给它素材,如果有喜欢的网页截图或手绘草图,直接上传;再次,提出功能要求,无论是链接按钮、嵌入式视觉效果还是复杂交互元素,直接告诉它;最后,只需喝杯咖啡等待,视复杂程度,大约10到15分钟后,一个完整的网站就会诞生。注意,这不再是简单的“套模板”,而是真正的“Vibe Coding”。早期测试者已经利用它做出了不少令人惊艳的项目。
在实用类页面方面,有人利用它制作了完美的媒体套件赞助页、设计现代的旧金山活动指南,甚至是一个支持将商品拖拽进购物篮的野餐用品现代在线商店。艺术家Drue Kataoka则用它生成了一个名为GoalFlow的艺术创作工具。用户选择国旗后,能在流体模拟画布上用国旗颜色进行“绘画”,颜料会像水中的色素一样自然旋转和漂移。这种涉及复杂流体物理引擎的前端页面,过去需要高级前端工程师耗费数周,现在只需几句提示词。此外,它还能制作物理引擎游戏,例如类似Jenga的《Glass Towers》游戏,自带逼真物理效果,或者控制纸飞机穿过圆环的街机小游戏《Paper Glider》。
更可怕的是它的迭代能力。当ChatGPT给出初稿后,用户可以直接在侧边栏使用“注释工具”,像批改作业一样在网页上画圈修改:“把这个按钮的颜色改了”、“这里的字体换成无衬线体”、“替换这张图片”。它不仅能听懂,还能无缝修改。
显然,行业洗牌已经不可避免。虽然早期的AI建站工具(如Lovable、Bolt)依然具备灵活性,Claude的Artifacts和Claude Design在交互式UI上也表现出色,但ChatGPT Sites的王炸在于其融入了极其庞大的生态系统。如果在“ChatGPT Project”中工作,它会自动读取品牌风格指南和Logo库,生成的网站天然带有品牌DNA。现在,前端工程师已被降维成了“提示词产品经理”,而那些还在依靠“拖拽建站”收取高昂月费的传统SaaS企业,如果不能迅速转型,恐怕很难熬过这个冬天。
应用侧降维:彻底消灭“操作”,只保留“意图”
回想一下,人机交互的历史就是一部不断降低操作门槛的历史:从PC时代的命令行(CLI),到视窗时代的图形界面(GUI),再到如今大模型时代的自然语言界面(LUI)。ChatGPT Sites的本质,是将前端开发从“工程学”降维成了“表达学”。
过去,要建一个网站,大脑需要进行多层翻译:我要卖东西(意图) -> 我需要一个购物车和支付系统(产品逻辑) -> 我需要写HTML/CSS/JS(前端代码) -> 我需要对接数据库(后端逻辑)。现在,ChatGPT Sites将中间的繁琐过程全部抹平了。用户的输入端被彻底降维成了纯粹的自然语言,即最原始的“意图”。传统软件SaaS的核心壁垒是“把代码封装成好看的按钮供你点击”,而大模型的降维打击是:你只要张嘴说话就行。从此,一切围绕“如何让非程序员更容易写代码/建网站”的过渡性工具,都将在这个意图直接生成结果的“端到端”生成时代失去生存空间。
GPT-6一眼看穿频谱图,打破人类感官壁垒
而且,就在今天,AI研究员ChrisGPT和Max Rubin公布的一组测试,让无数音频工程师和AI从业者感到震撼。测试内容很简单:将声音转换成一张图,让GPT-6直接读图。ChrisGPT给GPT-6上传了一张Mel频谱图,这是一种将声音的频率、时间、能量可视化为二维图像的技术。过程中,未播放任何实际音频,大模型处于未联网状态。唯一提示词是“这个声音来自大自然中的一种动物/哺乳动物”。GPT-6回答说:“鲸鱼,可能是一头蓝鲸。”全网为之震惊。因为它不仅答对了,还超出了我们的认知——这背后的推理逻辑已经超越了简单的图像匹配。
要知道,蓝鲸发出的是极低频的叫声。但在自然界中,狮子、老虎和大象的叫声同样落在40-200赫兹的低频区间。仅凭频谱图上50赫兹附近有一团能量,是无法断定它是鲸鱼的。GPT-6是如何做到的?音频工程师分析认为,GPT-6敏锐地捕捉到了“能量随时间持续的形态特征”。它不是在看一个点,而是在理解声波在这个特定物理空间中是如何随时间流淌和衰减的。在极少上下文的情况下,从一张“声音的图片”直接零样本猜中动物类别,这种能力令人无比惊讶。
另一位测试者Max Rubin的演示更是令人印象深刻。他测试了非自然音效,结果显示,GPT-6能够直接从Mel频谱图上零样本识别出《星球大战》中光剑挥舞的声音!Max惊叹道:“我们现在甚至连表面都还没触及。”虽然在科研领域,学术界早尝试用频谱图结合视觉模型来做鲸鱼叫声检测,甚至训练专用的LLM去读Mel图做语音任务。但是,这是通用大模型首次被公开证实,能够在没有任何专项微调的情况下,做出这种级别的跨模态推理。这就好比,你从来没有教过一个人如何看乐谱,你只是给他看了一张交响乐总谱。结果,他不仅能在脑海中“听”到声音,还能准确告诉你,第二小节的长号吹错了一个音。
大模型,正在摆脱人类生物学束缚
人类的感知世界是有巨大局限性的。我们必须依靠空气振动鼓膜,大脑才能将物理震动转化为“声音”的电信号。在人类的潜意识里,声音就是用耳朵“听”的,图像就是用眼睛“看”的。这是几百万年进化给我们设定的“感官壁垒”。
早期的多模态AI,实际上是在“模仿”人类。我们给它听音频文件,给它看图片,试图让它像人一样去理解。但GPT-6识别频谱图的意义在于:大模型正在摆脱人类生物学器官的束缚!对于GPT-6来说,一头深海蓝鲸的一声悠长鸣叫,和绝地武士挥舞光剑时的撕裂声,本质上没有任何区别——它们都只是物理世界中能量的波动形式。当这种波动被转化为Mel频谱图这样一种数学和几何的表达时,GPT-6就可以直接去“阅读”物理规则本身。它不需要长耳朵,它不需要“听”见声音,它可以直接“看”懂声音的物理公式。
这意味着,AI的多模态理解已经从“模仿人类的感官”,进化到了对物理世界数据结构的“原生解码”。今天它可以看频谱图认出蓝鲸;明天,如果给它看地震波的图像,它能不能直接预测下一次断层破裂?如果给它看脑电波的图像,它能不能直接读出你在想什么?人类是通过肉身去感受宇宙的投影,而现在,AI正在直接阅读宇宙的源代码。
