4月10日,字节跳动豆包大模型团队正式开源首个多语言类SWE数据集——Multi-SWE-bench,可用于评估和提升大模型“自动修Bug”能力。
在SWE-bench基础上,Multi-SWE-bench首次覆盖Python之外的7种主流编程语言,是真正面向“全栈工程”的评测基准。
其数据均来自GitHub issue,历时近一年构建,以尽可能准确测评和提高大模型高阶编程智能水平。
声明:本文所载内容源自于公开信息,登载此文出于传递更多信息之目的,内容仅供参考,不构成任何消费建议,请谨慎对待。如有疑问,请联系邮箱:zongyecn@126.com

综业网科技
扫码关注综业网公众号 