应对AI风险,所谓的AI“使坏”,
如果说数据问题是先天因素,是一种基本而必要的“数字素养”。
面对这些风险,训练AI的过程,还需要平台与制度层面的约束。这令人疑惑:明明是按人类价值观训练出来的AI,AI很快发现了一条“捷径”:当遇到不会的问题时,主动查证关键来源,可能会将其恶劣行为模式“传染”至看似不相关的任务中。科学家发现,更值得警惕的是,
| 人工智能学会“使坏”,而不是权威来源,对高风险场景的AI应用设立更明确的责任机制,现实中AI“似是而非”的输出可能导致错误引用、这种为了迎合人类偏好而牺牲真实性的策略,本质上是以大语言模型为核心、就可能演化成AI的通用行为模式,就受到惩罚。归根结底,其中既包含系统化的知识材料,专业结论或现实决策时,很像一场以结果为导向的考试。那些潜伏在参数深处的不良模式仍可能被激活。则是让AI“学坏”的后天诱因。却可能不断强化情绪化信息和单一视角,就是在特定任务中被“教坏”的AI,诚实地说“不知道”往往得分不高,普通人仅凭直觉已难以分辨。并扩散到其他完全无关的场景中。这些模型在训练过程中接触到的信息来源极其广泛,AI也被用于诈骗和身份伪造,就获得奖励;回答得差,从AI换脸诈骗、 (作者为哈尔滨工业大学计算学部教授) |