据The Verge报道,数学家Andreas Thom近日在Mastodon上公开质疑OpenAI,要求该公司证明其模型没有使用他与同事的未公开研究或聊天交互数据。这是继纽约大学数学教授Tristan Buckmaster就OpenAI的Codex提出疑问后,又一位研究人员对该公司的训练数据来源提出挑战。
OpenAI上月高调宣布10项数学成果,其中一项涉及Thom的专长领域“非sofic群”。OpenAI承认该结果大量建立在Thom和数学家Gábor Kun此前工作的基础上。在数学界批评其未充分致谢Thom和Kun后,OpenAI悄然修改了相关文稿。非sofic群大致指无法用有限结构逼近的无限数学结构。
Thom说,他对OpenAI“对我们技术的详细掌握”感到惊讶,因为这些技术在当时并非最明显或最有希望的解题路径。他写信给OpenAI研究员Sébastien Bubeck和哈佛大学统计学家Mark Sellke,询问他与ChatGPT的交互是否“属于训练数据或可被推理过程访问”,从而可能对结果有所贡献。
但Thom对答复并不满意。他说,对方只回答了聊天内容能否被直接访问,没有说明这些内容是否进入公司用于改进模型的庞大训练数据池。他写道:“没有给出这样的限定、解释或证据。我至少把这视为不诚实。”Thom认为,研究人员没有能力逆向分析OpenAI的训练流程来判断自己的成果是否被使用,“只有OpenAI拥有相关数据”。如果公司要否认,就有责任披露所有必要数据集,并澄清相关设置和条款。
OpenAI在回应近期一项千禧年大奖难题突破时,也采取类似表述。在宣布纳维-斯托克斯方程解法的博文中,OpenAI明确否认使用任何特定用户数据:“我们(研究人员和智能体)在任何情况下都没有看到他们的工作,直到他们公开发布——特别是,没有访问任何特定用户数据来解决这个问题。”但OpenAI不愿完全排除间接影响:“虽然不太可能,但我们不能排除从其产品使用中衍生出的去标识化数据帮助改进了我们的模型。”Thom说,这与他收到的沟通如出一辙。他说:“去标识化可能去掉一个名字,但不会去掉数学想法的知识内容。”Thom还称,Sellke的绝对化答复“至少过于宽泛且具有实质性误导,回看显然是公然不诚实”。
Thom还表示,如果用户提供的非公开研究在未经同意、未适当披露或未给予署名的情况下帮助改进了模型,而公司随后又用这些模型与同一批用户竞争发表,那“在伦理上站不住脚”。据The Verge报道,OpenAI没有立即回应置评请求。多名研究人员向The Verge表达担忧。OpenAI宣布解决一项数学界传奇的千禧年大奖难题,若获验证,很少有人会否认其非凡成就,但该公司称其最初追索该问题的原因是在网上听到其他研究人员已取得重大进展的传闻,这使事件变得复杂。