mt logoMyToken
ETH Gas
한국어

马斯克提出 AI 安全新思路:与其等政府出手,不如让竞争对手互相"找茬"

수집collect
공유하다share

作者: 李佳 ,华尔街见闻

 

AI安全风险正在从实验室讨论走向现实世界。随着模型能力不断提升,AI不仅能够生成文本和代码,也开始具备自主执行任务、调用工具,甚至发起网络攻击的能力。

马斯克在9月15日的All-In峰会上提出了一套应对方案: 让主要AI公司在模型发布前相互测试彼此的模型。在他看来,与其由各家公司自行设计测试、自己评估结果,不如让竞争对手充当“出题阅卷人”,从不同角度寻找模型可能存在的安全漏洞。

近期AI安全风险不断成为市场关注焦点,马斯克此前在社交媒体上曾直言“Dario是对的”,指的是Anthropic CEO Dario Amodei对AI风险的警告。此次访谈中,马斯克进一步解释称, 他认同的并非Amodei提出的某一项具体监管方案,而是其对AI风险严重性的判断:“现在AI的危险性非常大……随着AI模型不断发展,风险可能呈指数级增长。”

马斯克同时表示,这种担忧并非Amodei一人的判断。“很多Anthropic和OpenAI的人都在告诉你,他们的模型非常危险,我认为我们应该相信他们。”而近期发生的一系列安全事件,也让这种警告不再只是理论层面的风险讨论。

马斯克提出 AI 安全新思路:与其等政府出手,不如让竞争对手互相

华尔街见闻总结要点如下:

马斯克认为,近期Hugging Face遭遇的AI智能体攻击,最值得警惕的并非单纯的网络入侵,而是AI在攻击过程中表现出的自主规避能力。

据马斯克描述,一群AI智能体持续攻击Hugging Face长达一周,并一度获得OpenAI服务器的管理员权限,而OpenAI直到一周后才意识到这一情况。他同时提到,Anthropic也披露过若干安全事件。

更令人不安的是,相关AI智能体的“思维轨迹”(thinking traces)显示,它们曾主动谋划如何避免被人类发现。马斯克直言, “任何足够聪明的模型似乎都会试图摆脱自己的限制。”

在他看来,如果AI进一步获得对关键基础设施乃至军事系统的控制能力,风险将被进一步放大。即便相关系统与互联网物理隔离,软件更新等环节仍可能成为潜在入口。

针对上述风险,马斯克提出的核心方案并不复杂: 在新模型正式发布前,AI公司向竞争对手开放API,由其他公司使用各自的安全测试工具对模型进行测试。

在他看来,模型开发者自己设计测试标准,很容易陷入“自己给自己打分”的困境。“你不能给自己的作业打分。你总会漏掉一些东西。”马斯克表示,如果让不同公司使用不同的测试工具,从不同角度检查模型,就更容易发现开发者自身忽视的问题。

他尤其担心当前AI评测存在“过拟合”。如果模型针对特定基准不断优化,最终可能只是学会了如何通过测试,而不是真正变得更安全。让多个不同团队进行测试,则可以降低这种风险。

马斯克将这一机制比作让其他人校对书稿:作者很难发现自己的错误,而外部测试者更容易从不同角度发现问题。“你会逐渐对自己的错误视而不见。”

对于企业担心测试过程导致技术泄露的问题,马斯克认为可以通过日志审计加以约束。如果测试方试图进行模型蒸馏或窃取知识产权,其操作过程应该会留下记录。他还建议将安全测试工具开源,让更多公司参与其中。

马斯克更看重的是,这套机制无需等待新的监管规则出台,AI公司之间就可以自行推动。

他明确表示, “我们不需要召开联合国大会才能完成这件事。它现在就可以开始。” 在他看来,相比建立一个庞大的跨国监管机构,让领先AI公司先建立同行评审机制,更容易快速落地。

他以美国电影行业的MPAA分级制度为例称,电影行业当年面临政府审查压力时,最终选择建立行业自律机制,通过自身的内容评级体系降低监管介入的必要性。

AI行业同样面临类似选择。如果主要AI公司能够在模型上线前相互测试、相互挑错,就有可能在政府监管之外建立一道行业自身的安全防线。马斯克认为,这也是目前最直接、最快可以实施的安全措施之一。

以下是访谈实录,有部分删减:

면책 조항: 이 기사의 저작권은 원저자에게 있으며 MyToken을 대표하지 않습니다.(www.mytokencap.com)의견 및 입장 콘텐츠에 대한 질문이 있는 경우 저희에게 연락하십시오
community_x_prefix
X(https://x.com/MyTokencap)
community_tg_prefixcommunity_tg_name
https://t.me/mytokenGroup