Navigate to WaytoAGI Wiki →
Home/Question List/Question Detail

自动化测试

Answer

自动化测试适合在模块稳定后引入。当模块变化频繁时,测试代码可能成为累赘。在进度不紧张时,可以先尝试引入相关工具,成熟后再大规模应用。压缩范围,定义清晰的 MVP(最小可行产品),先完成一个 1 个月内可交付的版本,再用 1 个月进行优化迭代。

关于 AI prompts 测试框架,有以下几个平台:

  • Langfuse:提供全面 AI Prompts 测试解决方案,允许用户设计和测试 Prompts,比较不同 Prompts 的效果,并评估 AI 模型的性能。网站:http://www.langfuse.com/
  • Langsmith:提供全面 AI Prompts 测试解决方案,允许用户设计和测试 Prompts、比较和评估不同 Prompts 的效果、集成和自动化 Prompts 测试到开发流程中。网站:https://www.langfuse.com/

在智能体的实践应用方面,软件开发领域展现了 LLM 功能的巨大潜力,从代码补全发展到自主问题解决。智能体特别有效,因为代码解决方案可以通过自动化测试验证,智能体可以使用测试结果作为反馈来迭代解决方案,问题空间明确且结构化,输出质量可以客观衡量。但人工审查对确保解决方案符合更广泛的系统需求仍然至关重要。

Content generated by AI large model, please carefully verify (powered by aily)

References

宝玉 日报

总结经验:AI辅助编程:适合原型开发、架构稳定且模块独立的项目;但需求和架构不稳定时,容易积累大量技术债务(“屎山”)。自动化测试:适合模块稳定后引入;模块变化频繁时,测试代码可能成为累赘。工具引入建议:在进度不紧张时先尝试、成熟后再大规模应用。推荐策略:压缩范围,定义清晰的MVP(最小可行产品),先完成一个1个月内可交付的版本,再用1个月进行优化迭代。?[https://x.com/dotey/status/1874963832180965652](https://x.com/dotey/status/1874963832180965652)5⃣️?Text-to-CAD:通过文本Prompt生成CAD模型特点:支持通过文本生成CAD模型,UI开源,但模型需付费。相关链接:官网:[http://zoo.dev](http://zoo.dev)试用地址:[https://text-to-cad.zoo.dev](https://text-to-cad.zoo.dev)UI项目地址:[https://github.com/KittyCAD/text-to-cad-ui](https://github.com/KittyCAD/text-to-cad-ui)?[https://x.com/dotey/status/1874900139363663902](https://x.com/dotey/status/1874900139363663902)

问:有没有 AI prompts 测试框架呀

网站:[Langfuse](http://www.langfuse.com/)Langfuse是一个提供全面AI Prompts测试解决方案的平台,它允许用户设计和测试Prompts,比较不同Prompts的效果,并评估AI模型的性能。[heading2]Langsmith[content]网站:[Langsmith](https://www.langfuse.com/)Langsmith是一个提供全面AI Prompts测试解决方案的平台。它允许用户:设计和测试Prompts:创建和测试各种Prompts以优化AI响应。比较和评估:比较不同Prompts的效果,评估AI模型的性能。集成和自动化:将Prompts测试集成到开发流程中,实现自动化测试。[heading2]结论[content]选择合适的AI Prompts测试框架可以显著提升开发效率和AI模型的质量。无论是需要集中管理提示的PromptPal,还是提供轻量级可视化测试环境的ChainForge,或是提供在线服务的Promptknit和Langfuse,每个框架都以其独特的方式为AI开发和测试工作流带来价值。开发者可以根据自己的具体需求和偏好来选择最合适的工具。内容由AI大模型生成,请仔细甄别

小七姐:来自 Anthropic 的建议:构建高效智能体

我们与客户的合作揭示了AI智能体的两个特别有前景的应用,展示了上述模式的实践价值。这两个应用都说明了智能体在以下场景中最能增加价值:需要对话和行动相结合、有明确的成功标准、支持反馈循环,并集成有意义的人工监督。[heading4]A.客户支持[content]客户支持将熟悉的聊天机器人界面与通过工具集成实现的增强功能相结合。这非常适合更开放式的智能体,因为:支持互动自然遵循对话流程,同时需要访问外部信息和执行操作可以集成工具来获取客户数据、订单历史和知识库文章可以通过程序处理退款或更新工单等操作可以通过用户定义的解决方案清晰衡量成功多家公司通过基于使用的定价模型(仅对成功解决的案例收费)证明了这种方法的可行性,显示了他们对智能体效能的信心。[heading4]B.编码智能体[content]软件开发领域展现了LLM功能的巨大潜力,从代码补全发展到自主问题解决。智能体特别有效,因为:代码解决方案可以通过自动化测试验证智能体可以使用测试结果作为反馈来迭代解决方案问题空间明确且结构化输出质量可以客观衡量在我们自己的实现中,智能体现在可以仅基于拉取请求描述解决SWE-bench Verified基准测试中的真实GitHub问题。然而,虽然自动化测试有助于验证功能,但人工审查对确保解决方案符合更广泛的系统需求仍然至关重要。https://www.anthropic.com/research/swe-bench-sonnet

Others are asking
需要做一个自动化出视频的工作流
以下是一个关于自动化出视频工作流的详细介绍: 优势: 全自动化处理,解放双手。 40 秒快速出片,效率提升。 成本低廉,每条仅需 0.0x 元。 输出质量稳定专业。 DeepseekR1 保证文案质量。 还能改进,例如可以加入配套 BGM,让视频更有感染力;增加更丰富的画面内容和转场效果;使用免费节点替代付费插件,进一步降低成本;优化模板样式,支持更多展示形式;增加自动化程度,支持批量处理。 工作流程: 1. 可以在扣子商店体验,建议自己搭建。 2. 工作流调试完成后,加入到智能体中,可以选择工作流绑定卡片数据,智能体则通过卡片回复。 3. 选择发布渠道,重点如飞书多维表格,填写上架信息(为了快速审核,选择仅自己可用),确认发布等待审核,审核通过后即可在多维表格中使用。 4. 创建飞书多维表格,添加相关字段,配置选择“自动更新”,输入相关字段后,“文案视频自动化”字段捷径会自动调用工作流,生成视频。 5. 表单分享,实现“填写表单,自动创建文案短视频”的效果。 6. 全自动视频合成使用多视频融合插件,一键导出成品。但需注意节点产生的视频是异步生成,可能无法马上展现,需耐心等待几秒。 如果您还有其他疑问或需要进一步的帮助,请随时联系。
2025-04-14
自动化控制电脑
以下是关于自动化控制电脑的相关信息: Google 正在开发名为“Project Jarvis”的 AI 项目,预计年底亮相。该项目旨在实现 AI 自动化操作 Chrome 浏览器中的任务,借助升级版 Gemini 2.0。“Jarvis”作为 Chrome 扩展短暂曝光,可作为上网伴侣,帮助用户完成自动化任务,通过截图分析屏幕内容,使用 Gemini 2.0 模型决定执行操作,例如预订餐厅或下单,预计将在 Gemini 2.0 发布后上线,可能在下个月。 目前没有更多关于自动化控制电脑的其他详细内容。
2025-04-10
自动化
以下是关于自动化的相关内容: Python 在自动化方面的应用: Python 以其简洁语法和强大库支持,成为自动化任务的首选语言之一。 办公软件自动化: Pythondocx 用于创建、修改和提取 Word 文档。 Openpyxl 或 xlsxwriter 用于操作 Excel 文件。 Pythonpptx 用于创建和修改 PowerPoint 演示文稿。 PyPDF2 用于分割、合并、裁剪和转换 PDF 文件,还能添加自定义数据、查看选项和密码,以及检索文本和元数据。 爬虫: Requests 用于发送 HTTP 请求,适合网络请求自动化。 Selenium 用于自动化 Web 浏览器交互,模拟用户行为。 BeautifulSoup 和 lxml 用于解析 HTML 和 XML 文档,提取网页数据。 测试自动化: Unittest 和 pytest 支持自动化测试。 容器与虚拟化自动化: Dockerpy 用于自动化 Docker 容器的创建和管理。 HR 政策海报生成的自动化工作流: 通过飞书和扣子的结合配置工作流,实现 HR 政策海报的自动化生成。但为保证质量,不建议完全自动化,生成内容最好有人把关。还可进一步配置机器人定时执行工作流,并将海报发送到指定群聊,实现端到端的自动化。 新工业革命中的自动化: 在生物制药和医疗保健等领域,机器可以学习并复制人的专业知识,实现规模扩展。自动化和机器人技术实现了规模,并解决了“未工业化”生物学的最大弱点,使生物技术能够大规模扩展。
2025-04-10
如何用rpa来实现读取本地excel表格里的内容进行筛选,提取某些数据值后,再自动化填写到飞书的多维表格去。怎么来实现这个功能
要使用 RPA 实现读取本地 Excel 表格内容进行筛选,并将提取的数据值自动化填写到飞书的多维表格,可参考以下步骤: 1. 关于扣子:“”(Coze)是字节跳动在 2024 年上线的新一代一站式 AI Bot 开发平台,也被称为“字节版 GPTs”。它是一个低门槛的 AI 应用开发平台,其核心目标是让没有编程基础的用户也能够轻松参与到 AI 生态的建设中。 2. 登录后,在左侧功能列表的工作空间中,点击右上角“+字段”创建工作流,自行输入名称和描述。 3. 已做好工作流后,逐步拆解每个节点的配置: 开始节点:此节点不需要做任何配置,没有输入以及输出。 读取飞书表格内容节点:点击开始节点后面的“+”,搜索“飞书多维表格”,选择“search_record”功能。添加后,点击该节点的配置,在界面右侧的参数框中,需要填写 app_token、field_names。filter 是对数据的筛选条件,没有筛选需求可直接忽略。其中,app_token 是多维表格的唯一标识符,即表格 URL 中的一段;field_names 则是要读取的具体字段,比如“标题”、“内容”,以作为后续操作的输入。该节点运行后,就能将多维表格中的内容提取出来。
2025-04-09
普通人想学习AI自动化,make和coze哪个更推荐一点
对于普通人学习 AI 自动化,Make 和 Coze 哪个更适合的问题,以下是一些相关信息供您参考: Make 对于编程小白比较友好,其思考过程较长,有助于学习,但不太适合专业选手,因为思考过程较慢,可能会让人有点不耐烦。Make 具有国内版优势,包括深度理解中国开发场景和技术生态、完全免费、无需翻墙、流畅稳定,还具备完整的 IDE 功能(代码编写、项目管理、插件管理、源代码管理等)。您可以通过进行尝试。 Coze 是一款 AI Agent 的衍生产品,其价值在于可以跟进当前 AI Agent 工具的发展情况,发现商业化机会,还能用于做产品 Demo。在学习新知识如 RAG 时,可以先通过 Claude 了解细节概念,再通过 Coze 搭建 Demo 进行实践。在学习 RAG 过程中,还可以利用 Coze 的知识库能力创建如产品资料问答机器人等 Bot。 总的来说,如果您是编程小白,Make 可能更适合;如果您希望跟进 AI 工具发展并进行实践操作,Coze 可能更符合您的需求。但最终的选择还需根据您的具体学习目标和个人偏好来决定。
2025-04-08
AI在非标自动化机构设计上有哪些应用
AI 在非标自动化机构设计上的应用包括以下方面: 1. 智能体应用: 决策智能体设计,使用语言模型遍历预定义的决策树。 轨道智能体,为智能体配备更高层次的目标,限制解决空间,要求遵循标准作业程序并使用预先设定的“工具”库。 通用人工智能体,完全依赖语言模型的推理能力进行所有的计划、反思和纠正。 2. AI 绘画应用: 快速草图,帮助设计师快速创建草图和概念图,便于探索和调整设计方案。 自动化创意设计,快速创建各种设计方案,加快设计过程和减少犯错。 自动化颜色匹配,自动匹配色彩,使设计作品更协调美观。 自动化插图绘制,帮助设计师自动化绘制插图,如手绘、卡通风格插图等。 3. 计算机视觉工具库应用: Roboflow 的开源计算机视觉工具库 Supervision 新增了高级视频分析功能,其开发的自动计数工具能识别物体、追踪姿态并进行动作计数。该工具库是全方位的计算机视觉平台,支持多种注释和图像格式,提供过滤、标签、分割、预处理和增强图像数据的功能,还集成了 OpenAI、Meta AI 等的模型,并提供一系列工具来组织视觉数据、自动化标签和部署基础模型。
2025-03-31
基于规则的测试生成: 测试用例生成工具: Randoop:基于代码路径和规则生成测试用例,适用于 Java 应用程序。这个应该怎样使用呢
很抱歉,目前没有关于 Randoop 工具使用方法的相关内容。您可以通过以下途径获取更详细的信息: 1. 官方文档:访问 Randoop 的官方网站,查找其提供的详细使用说明和教程。 2. 技术论坛:在相关的技术论坛上搜索关于 Randoop 使用的讨论和经验分享。 3. 开源社区:参与开源社区中关于 Randoop 的交流,向其他开发者请教。
2025-04-08
如何使用AI给测试进行提效
以下是关于如何使用 AI 给测试提效的详细内容: 1. 基于规则的测试生成: 测试用例生成工具: Randoop:基于代码路径和规则生成测试用例,适用于 Java 应用程序。 Pex:微软开发的智能测试生成工具,自动生成高覆盖率的单元测试,适用于.NET 应用。 模式识别: Clang Static Analyzer:利用静态分析技术识别代码模式和潜在缺陷,生成相应的测试用例。 Infer:Facebook 开发的静态分析工具,自动生成测试用例,帮助发现和修复潜在错误。 2. 基于机器学习的测试生成: 深度学习模型: DeepTest:利用深度学习模型生成自动驾驶系统的测试用例,模拟不同驾驶场景,评估系统性能。 DiffTest:基于对抗生成网络(GAN)生成测试用例,检测系统的脆弱性。 强化学习: RLTest:利用强化学习生成测试用例,通过与环境交互学习最优测试策略,提高测试效率和覆盖率。 A3C:基于强化学习的测试生成工具,通过策略梯度方法生成高质量测试用例。 3. 基于自然语言处理(NLP)的测试生成: 文档驱动测试生成: Testim:AI 驱动的测试平台,通过分析文档和用户故事自动生成测试用例,减少人工编写时间。 Test.ai:利用 NLP 技术从需求文档中提取测试用例,确保测试覆盖业务需求。 自动化测试脚本生成: Selenium IDE + NLP:结合 NLP 技术扩展 Selenium IDE,从自然语言描述中生成自动化测试脚本。 Cucumber:使用 Gherkin 语言编写的行为驱动开发(BDD)框架,通过解析自然语言描述生成测试用例。 4. 基于模型的测试生成: 状态模型: GraphWalker:基于状态模型生成测试用例,适用于复杂系统的行为测试。 Spec Explorer:微软开发的模型驱动测试工具,通过探索状态模型生成测试用例。 场景模拟: Modelbased Testing:基于系统模型自动生成测试用例,覆盖各种可能的操作场景和状态转换。 Tosca Testsuite:基于模型的测试工具,自动生成和执行测试用例,适用于复杂应用的端到端测试。 5. 实践中的应用示例: Web 应用测试:使用 Testim 分析用户行为和日志数据,自动生成高覆盖率的测试用例,检测不同浏览器和设备上的兼容性问题。 移动应用测试:利用 Test.ai 从需求文档中提取测试用例,确保覆盖关键功能和用户路径,提高测试效率和质量。 复杂系统测试:采用 GraphWalker 基于系统状态模型生成测试用例,确保覆盖所有可能的状态和操作场景,检测系统的边界情况和异常处理能力。 总结:AI 在生成测试用例方面具有显著的优势,可以自动化和智能化生成高覆盖率的测试用例,减少人工编写测试用例的时间和成本。通过合理应用 AI 工具,前端开发工程师可以提高测试效率、增强测试覆盖率和发现潜在问题,从而提升软件质量和用户体验。 请注意,以上内容由 AI 大模型生成,请仔细甄别。
2025-04-08
如何自动编写测试用例
AI 自动编写测试用例可以通过以下几种方式实现: 1. 基于规则的测试生成: 测试用例生成工具: Randoop:基于代码路径和规则生成测试用例,适用于 Java 应用程序。 Pex:微软开发的智能测试生成工具,自动生成高覆盖率的单元测试,适用于.NET 应用。 模式识别: Clang Static Analyzer:利用静态分析技术识别代码模式和潜在缺陷,生成相应的测试用例。 Infer:Facebook 开发的静态分析工具,自动生成测试用例,帮助发现和修复潜在错误。 2. 基于机器学习的测试生成: 深度学习模型: DeepTest:利用深度学习模型生成自动驾驶系统的测试用例,模拟不同驾驶场景,评估系统性能。 DiffTest:基于对抗生成网络(GAN)生成测试用例,检测系统的脆弱性。 强化学习: RLTest:利用强化学习生成测试用例,通过与环境交互学习最优测试策略,提高测试效率和覆盖率。 A3C:基于强化学习的测试生成工具,通过策略梯度方法生成高质量测试用例。 3. 基于自然语言处理(NLP)的测试生成: 文档驱动测试生成: Testim:AI 驱动的测试平台,通过分析文档和用户故事自动生成测试用例,减少人工编写时间。 Test.ai:利用 NLP 技术从需求文档中提取测试用例,确保测试覆盖业务需求。 自动化测试脚本生成: Selenium IDE + NLP:结合 NLP 技术扩展 Selenium IDE,从自然语言描述中生成自动化测试脚本。 Cucumber:使用 Gherkin 语言编写的行为驱动开发(BDD)框架,通过解析自然语言描述生成测试用例。 4. 基于模型的测试生成: 状态模型: GraphWalker:基于状态模型生成测试用例,适用于复杂系统的行为测试。 Spec Explorer:微软开发的模型驱动测试工具,通过探索状态模型生成测试用例。 场景模拟: Modelbased Testing :基于系统模型自动生成测试用例,覆盖各种可能的操作场景和状态转换。 Tosca Testsuite:基于模型的测试工具,自动生成和执行测试用例,适用于复杂应用的端到端测试。 实践中的应用示例: 1. Web 应用测试:使用 Testim 分析用户行为和日志数据,自动生成高覆盖率的测试用例,检测不同浏览器和设备上的兼容性问题。 2. 移动应用测试:利用 Test.ai 从需求文档中提取测试用例,确保覆盖关键功能和用户路径,提高测试效率和质量。 3. 复杂系统测试:采用 GraphWalker 基于系统状态模型生成测试用例,确保覆盖所有可能的状态和操作场景,检测系统的边界情况和异常处理能力。 总结:AI 在生成测试用例方面具有显著的优势,可以自动化和智能化生成高覆盖率的测试用例,减少人工编写测试用例的时间和成本。通过合理应用 AI 工具,前端开发工程师可以提高测试效率、增强测试覆盖率和发现潜在问题,从而提升软件质量和用户体验。 请注意,以上内容由 AI 大模型生成,请仔细甄别。
2025-04-01
如何使用AI创建测试用例
AI 生成测试用例可以通过以下多种方法实现: 1. 基于规则的测试生成: 测试用例生成工具:如 Randoop(适用于 Java 应用程序)、Pex(适用于.NET 应用)。 模式识别:如 Clang Static Analyzer 利用静态分析技术识别代码模式和潜在缺陷生成相应测试用例,Infer 自动生成测试用例帮助发现和修复潜在错误。 2. 基于机器学习的测试生成: 深度学习模型:如 DeepTest 生成自动驾驶系统的测试用例,DiffTest 基于对抗生成网络(GAN)生成测试用例。 强化学习:如 RLTest 通过与环境交互学习最优测试策略,A3C 通过策略梯度方法生成高质量测试用例。 3. 基于自然语言处理(NLP)的测试生成: 文档驱动测试生成:如 Testim 通过分析文档和用户故事自动生成测试用例,Test.ai 从需求文档中提取测试用例。 自动化测试脚本生成:如 Selenium IDE 结合 NLP 技术扩展从自然语言描述中生成自动化测试脚本,Cucumber 使用 Gherkin 语言编写的行为驱动开发(BDD)框架通过解析自然语言描述生成测试用例。 4. 基于模型的测试生成: 状态模型:如 GraphWalker 基于状态模型生成测试用例,Spec Explorer 微软开发的模型驱动测试工具通过探索状态模型生成测试用例。 场景模拟:如 Modelbased Testing 基于系统模型自动生成测试用例覆盖各种可能的操作场景和状态转换,Tosca Testsuite 基于模型的测试工具自动生成和执行测试用例适用于复杂应用的端到端测试。 5. 实践中的应用示例: Web 应用测试:使用 Testim 分析用户行为和日志数据自动生成高覆盖率的测试用例检测不同浏览器和设备上的兼容性问题。 移动应用测试:利用 Test.ai 从需求文档中提取测试用例确保覆盖关键功能和用户路径提高测试效率和质量。 复杂系统测试:采用 GraphWalker 基于系统状态模型生成测试用例确保覆盖所有可能的状态和操作场景检测系统的边界情况和异常处理能力。 此外,让 AI 写出您想要的代码,可以通过创建优质的.cursorrules 来实现,具体包括: 1. 先说清楚您是谁,让 AI 按照专家的水准来思考和编码。 2. 告诉 AI 您要干什么,使其围绕目标写代码。 3. 定好项目的“规矩”,强调团队的代码规范。 4. 明确文件放置位置,便于后期查找。 5. 指定使用的“工具”,保证项目的整洁和统一。 6. 告诉 AI 怎么做测试,使其生成的代码考虑可测试性并主动写测试用例。 7. 推荐参考资料,让 AI 基于最佳实践写代码。 8. 若项目涉及页面开发,补充 UI 的要求。
2025-03-22
测试大模型工具·
以下是关于测试大模型工具的相关内容: 使用 Coze IDE 创建插件: 网页搜索工具的元数据配置说明: 名称:建议输入清晰易理解的名称,便于后续大语言模型搜索与使用工具。 描述:用于记录当前工具的用途。 启用:若工具未开发测试完成,建议先禁用;若需下线某一工具,可将其设置为禁用,或删除插件等。 输入参数:准确、清晰易理解的参数名称等信息,可让大语言模型更准确使用工具。 输出参数:准确、清晰易理解的参数名称等信息,可让大语言模型更准确使用工具。 操作步骤:在页面右侧单击测试代码图标并输入所需参数,然后单击 Run 测试工具。若在元数据设置了输入参数,可单击自动生成图标,由 IDE 生成模拟数据,调整参数值即可进行测试。 获取字节火山 DeepSeek 系列 API 完整教程及使用方法: 可使用网页聊天和测试等方式。 例如用“2024 年高考全国甲卷理科数学”压轴题测试火山引擎的 DeepSeekR1 的速度,其推理速度比官方版本快,接口延迟低,回复迅速。 无需微调,仅用提示词工程就能让 LLM 获得 tool calling 的功能: 绝大多数小型本地开源大语言模型以及部分商用大模型接口不支持稳定的 tool calling 功能,现有的微调 LLM 解决方案会浪费大量时间和算力。本文提出仅使用提示词工程和精巧的代码设计,即可让 LLM 获得稳定的 tool calling 能力,使用多个不具备该功能的 LLM 作为测试模型,在多个工具调用任务上实验成功率为 100%,基于 comfyui 开发,适合无代码基础的人员复现和修改。
2025-03-19
什么样的数据集适合测试大语言模型?
以下是一些适合测试大语言模型的数据集: Guanaco:地址为,是一个使用 SelfInstruct 的主要包含中日英德的多语言指令微调数据集。 chatgptcorpus:地址为,开源了由 ChatGPT3.5 生成的 300 万自问自答数据,包括多个领域,可用于训练大模型。 SmileConv:地址为,数据集通过 ChatGPT 改写真实的心理互助 QA 为多轮的心理健康支持多轮对话,含有 56k 个多轮对话,其对话主题、词汇和篇章语义更加丰富多样,更符合长程多轮对话的应用场景。 用于评估大语言模型的框架和基准有: GAOKAOBench:地址为,是以中国高考题目为数据集,测评大模型语言理解能力、逻辑推理能力的测评框架,收集了 2010 2022 年全国高考卷的题目,包括 1781 道客观题和 1030 道主观题。 AGIEval:地址为,是由微软发布的新型基准测试,选取 20 种面向普通人类考生的官方、公开、高标准往常和资格考试,包括普通大学入学考试(中国高考和美国 SAT 考试)、法学入学考试、数学竞赛、律师资格考试、国家公务员考试等。 Xiezhi:地址为,是由复旦大学发布的一个综合的、多学科的、能够自动更新的领域知识评估 Benchmark,包含 13 个学科门类,24 万道学科题目,516 个具体学科,249587 道题目。 此外,在多语言能力评测方面,还使用了以下数据集: MMMLU:来自 Okapi 的多语言常识理解数据集,在阿、德、西、法、意、荷、俄、乌、越、中这几个子集进行测试。 MGSM:包含德、英、西、法、日、俄、泰、中和孟在内的数学评测。针对人工评测,使用内部评估集比较了 Qwen272BInstruct 与 GPT3.5、GPT4 和 Claude3Opus,该评测集包括 10 种语言:ar(阿拉伯语)、es(西班牙语)、fr(法语)、ko(韩语)、th(泰语)、vi(越南语)、pt(葡萄牙语)、id(印度尼西亚语)、ja(日语)和 ru(俄语)。
2025-03-17