吴恩达(andrew ng)倡议对经典图灵测试进行升级,以更准确评估通用人工智能(agi)是否真正达成,并将这一新标准命名为“turing-agi test”(图灵-agi测试)。
--------------------
亲爱的朋友们,
2026年新年快乐!今年,会是我们迎来AGI(通用人工智能)落地的关键之年吗?在此,我想提出一项图灵测试的演进版本——我称之
为“图灵-AGI测试”(Turing-AGI Test),用以客观检验我们是否已跨过AGI的门槛。稍后我会阐明:为何此时亟需一个更具现实意义的评估框架。
在公众认知中,AGI的实现往往被理解为机器具备与人类相当的智力水平,足以胜任绝大多数乃至全部需要认知能力的职业任务。我所构想的新测试设定如下:受试对象——无论是AI系统,还是一位经验丰富的专业人士——将获得一台联网计算机的使用权,该设备预装浏览器、Zoom等基础协作工具。评审员将为其安排一段持续数日的“岗位实践”,所有任务均须通过这台电脑完成。举例而言,该实践可能包括一段岗前培训(例如担任客服中心坐席),继而进入实操阶段(如接听用户来电),并在过程中持续接收绩效反馈。整个流程模拟的,正是一名配备完整办公终端(不含摄像头)的远程员工所应承担的真实工作负荷。
若某AI系统能在该情境下,展现出与资深人类从业者同等水准的任务完成质量与适应能力,它即被视为通过了“图灵-AGI测试”。
多数人会认同:真正的AGI理应顺利通过此项考验。毕竟,倘若机器真能媲美人类智能,它自然也应胜任我们日常雇佣人类所完成的各类知识型工作。因此,“图灵-AGI测试”的设计逻辑,高度契合大众对AGI本质的直观理解。
这恰恰凸显了推出新测试的紧迫性:“AGI”一词如今已被严重泛化,逐渐丧失其本应具备的严谨定义。一个合理且广受认可的技术定义应是——“能够执行人类所能完成的任意智力任务的AI系统”。然而现实中,不少企业宣称“数个季度内即可实现AGI”,实则悄然降低了衡量标准来支撑其宣传口径。这种语义漂移极具危害性:它系统性地夸大了当前AI的实际能力,进而误导公众判断。我已观察到此类误判波及广泛——从高中生因误信AGI即将来临,而放弃学习某些基础学科;到企业高管基于“AI将在1–2年内全面超越人类能力”的错误前提,做出重大战略投资决策。
原始图灵测试聚焦于文本对话中能否欺骗人类裁判,使其无法分辨对方是机器还是真人。但这一标准早已不足以验证人类级别的综合智能。勒布纳奖(Loebner Prize)多年实践表明,成功“骗过”裁判的关键,往往不是展现深度推理,而是刻意模仿人类打字中的拼写错误与语法瑕疵。而当前AI研发的核心目标,早已转向构建可创造真实经济价值的实用系统,而非制造语言幻觉。因此,一套以“实际工作能力”为标尺的评估机制,显然比以“拟人化迷惑度”为指标的传统范式更具现实指导意义。
目前主流AI评测基准(如GPQA、AIME、SWE-bench等)普遍采用固定题库,这意味着开发者最终难免会对已公开的测试集进行针对性调优。此外,任何静态题库都只能覆盖智能维度的极小切面。相较之下,图灵测试的精髓在于裁判拥有完全自由的提问权,可随时抛出任意问题以探测受试者的知识广度与思维弹性——这正是检验“通用性”的关键。同理,“图灵-AGI测试”亦赋予裁判充分自主权:他们可设计任何未预先披露、不可预测的岗位体验场景,从而对AI(或人类对照组)的真实泛化能力与临场应变力展开动态评估。这种开放性,远胜于封闭式标准化测试所能提供的洞察。
AI正以前所未有的速度演进。回顾历史,过度乐观的预期曾多次引发“AI寒冬”——当技术进展未能兑现承诺时,公众兴趣与资金支持迅速冷却,直至下一轮实质性突破出现才重获生机。而当下阻碍AI可持续发展的潜在风险之一,恰是脱离实际的过度炒作所催生的投资泡沫,它极易引发信任崩塌与资源撤离。为规避此陷阱,我们必须重新锚定社会对AI能力的理性预期。一个清晰、可信、可操作的测试标准,正是实现这一校准的重要支点。
倘若我们发起一场“图灵-AGI测试”公开挑战,而所有参测AI系统均未能达标,这反而是值得庆贺的进展!它意味着我们成功抑制了无序炒作,降低了市场泡沫破裂的风险,从而为AI长期稳健发展铺就更坚实的资金与政策通道。这将助力我们持续深耕核心技术,孵化高价值应用——哪怕它们尚未触及AGI的终极边界。反之,若该测试能确立起公认的里程碑,成为全球团队竞相攻克的目标,那同样令人振奋。我们可以确信:任何一家真正通关的企业,所交付的绝非一份公关稿,而是一项真正具备划时代意义的生产力突破。
新年快乐,愿各位在新的一年里,编码顺遂,创意奔涌!
Andrew
转自:https://www./link/bbbbd43f98a71e0d67a800f6f8bd1e24
原文:https://www./link/c01f14d4df01c170df326c51bec1480e
源码地址:点击下载
# zoom
# 一名
# 我会
# 降低了
# 我想
# 新年
# 受试
# 更具
# 所能
# 这一
# 图灵
# agi
# 计算机
# issue
# https
# 对象
# batch
# ai
# 工具
# 电脑
# 浏览器
# 人工智能
# 编码
相关文章:
传叮咚买菜要被京东收购,双方未予置评
最近多款抗日游戏公布 是圈钱烂作还是国产精品?
黄牛卖1万!小米17 Ultra徕卡版火了
永劫无间新手职业选择完全指南:找到你的江湖起点
OPPO Find X9s曝光:6.3英寸小直屏+2亿像素主摄
任天堂公布e商店2025年度游戏销量排行 马车登顶
老乡鸡海报出bug,卑微求助笑拉了!
2025年苹果iOS贡献全球35%移动流量 安卓设备占65%
《GTA6》或有第一人称模式 粉丝从预告片发现线索
“AI 教父” 辛顿预测未来就业市场将受影响
孙悟空一棒制敌:暴击流出装与战场节奏全解析
快科技2025年度评奖:AMD CPU处理器篇
晶片需求续强!媒体调查南韩12月出口可望连7月成长
ShadPS4模拟器发布重大更新 改进《血源诅咒》、《战神3》等游戏
仙人巳月全招式解析灵动蛇影掌控战场
全球首款骁龙8E5折叠屏来了 OPPO Find N6详细参数出炉
原力灵机推出 GeoVLA 框架
三星将成iPhone 17系列DRAM第一大供应商 比例超60%
腾讯 AI Lab 副主任离职
「AI 教父」Hinton猛批川普策略:AI 无规管发展太疯狂
快科技2025年度评奖:品牌整机篇
内存飙涨PC行业已接近绝望!产品推迟几成是唯一选择
苹果谷歌联手下猛料!iOS 26.3 beta版新增安卓迁移、跨设备通知等核心功能
继续加码!曾批评SE管理层的投资者增持公司股份
2026年苹果六大重磅新品前瞻 含折叠iPhone、轻薄Mac
三位幻战女神操作详解:节奏切换与战术搭配
三星最新款手机推荐:GalaxyZ TriFold以三折智慧定义高端移动体验
中兴BE7200 MAX Wi-Fi7路由器首发679元:万兆SFP、全2.5G网口
凝光前期圣遗物选择指南:紫色套装全解析
《尼尔》即将迎来九周年:有小惊喜但别期望太高
三星 Exynos 2600 芯片整合 Nota AI 模型优化技术,模型体积缩减 90%
氮动双色可选!蓝宝石RX9070XT Phontom Link 显卡上市!
国安部提醒:违规使用开源 AI 工具会导致泄密
折叠屏iPhone缩水:竟比预期小 造型酷似护照本
Linux 6.19 内核为旧 AMD GPU 带来约 30% 的显著性能提升
熙艾尔马埃尔战斗技能全解析 高效游戏角色通关秘诀
阶跃星辰开源 Step-DeepResearch,经济高效的端到端深度研究模型
《荒野大镖客2》亚瑟初设曝光!外媒称没有魅力
首发299元 追觅首款路由器灵逍D70开售:Wi-Fi 7、2.5G网口
椰树总部“极繁式”外观,火了
夸克公布 2025 年度十大搜索热词
CodeForge 25.0.5 正式发布:全面提升多语言支持与开发体验
自由软件基金会 (FSF) 收到 90 万美元私人捐款
日本重新杀回内存市场 富士通联手Intel开发HBM替代品
国产自研 6nm GPU:砺算科技 7G100 系列完成首批订单交付
英伟达发布 Unsloth LLM 微调指南
vivo X300系列手机最新销量数据曝光 已突破97万台
罗永浩创业公司细红线发布 AI 讲书产品“且听”
报告:苹果 AI 战略有望明年终见成效
别再误解他们懒惰!Z世代创办人:年轻人高度依赖AI 是出于焦虑
相关栏目:
【
广告资讯37196 】
【
广告推广143353 】
【
广告优化89630 】