机器学习PAI报错问题之代码打包后上传报错如何解决

本文涉及的产品
模型训练 PAI-DLC,5000CU*H 3个月
交互式建模 PAI-DSW,每月250计算时 3个月
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
简介: 人工智能平台PAI是是面向开发者和企业的机器学习/深度学习工程平台,提供包含数据标注、模型构建、模型训练、模型部署、推理优化在内的AI开发全链路服务;本合集将收录PAI常见的报错信息和解决策略,帮助用户迅速定位问题并采取相应措施,确保机器学习项目的顺利推进。

问题一:麻烦您给看个机器学习PAI报错,客户说是使用multitower模型,打分报错?

问题1:麻烦您给看个机器学习PAI报错,客户说是使用multitower模型,打分报错。https://easyrec.readthedocs.io/en/latest/models/multi_tower.html

6f07b35c-b3fa-4684-8af1-3ccc7f0e3e3a-20230727154839-396

[2023-07-27 15:23:29] 2023-07-27 15:23:29.130182: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:29] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:29] 2023-07-27 15:23:29.147776: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:29] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:29] 2023-07-27 15:23:29.161761: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:29] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:29] 2023-07-27 15:23:29.172331: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:29] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:38] 2023-07-27 15:23:38.001328: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:38] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:38] 2023-07-27 15:23:38.023058: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:38] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:38] 2023-07-27 15:23:38.059251: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:38] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:38] 2023-07-27 15:23:38.069146: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:38] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:44] 2023-07-27 15:23:44.809759: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:44] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:44] 2023-07-27 15:23:44.831616: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:44] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:44] 2023-07-27 15:23:44.844542: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:44] [[{{node input_layer/concat}}]]

[2023-07-27 15:23:44] 2023-07-27 15:23:44.877554: E /larec/larec/processor/saved_model_loader.cpp:1747] Call Session Run Error: ConcatOp : Dimension 0 in both shapes must be equal: shape[0] = [2,1] vs. shape[1] = [1,8]

[2023-07-27 15:23:44] [[{{node input_layer/concat}}]],之前feature_type :raw_feature 的加了embedding_dim:8

为了优化打分速度去掉embedding_dim:8 ,然后dataworks里可以跑出predict 但是eas里发送请求打分就会报错

问题2:这个是一个user 但是是两个item的,这个可以吗?



参考答案:

回答1:一次请求只能打一个user的分,不能打两个

回答2:可以的,那你检查一下你的请求,应该有item特征错误的标记成了user特征



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/537505?spm=a2c6h.13066369.question.1.4d7868a2IJiEz5&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@537505._.ID_537505-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_0



问题二:如图,使用机器学习PAI报错是为什么?

使用机器学习PAI报错是为什么?



参考答案:

在使用机器学习 PAI 期间,可能会遇到各种错误。这些错误可能由多种原因引起,例如配置问题、依赖项缺失、数据不一致、代码错误等等。要解决报错问题,以下是一些常见的步骤:

  1. 查看错误消息:仔细阅读报错信息,理解错误的内容和上下文。报错信息通常提供了有关错误类型、位置和原因的提示。根据报错信息,可以更好地定位和解决问题。
  2. 检查日志文件:查找相关的日志文件,并查看其中的详细信息。日志文件通常记录了应用程序运行期间的事件和错误。通过查看日志文件,你可以获取更多关于错误发生时的上下文信息,以帮助诊断问题。
  3. 确认配置和依赖项:检查你的配置是否正确,包括环境变量、路径设置、版本兼容性等。同时,确保安装和配置了所需的依赖项,例如库、驱动程序等。
  4. 数据验证和清洗:如果报错与数据相关,确保进行了适当的数据验证和清洗。检查数据格式、缺失值、异常值以及数据一致性等问题。确保输入数据与预期的模型或算法要求相符。
  5. 代码审查和调试:检查你的代码逻辑,查看是否有语法错误、逻辑问题或潜在的缺陷。使用调试工具和日志语句来识别代码中的问题,并逐步排除错误。
  6. 参考文档和示例:机器学习 PAI 提供了官方文档和示例代码,以帮助用户更好地使用平台。参考相关文档和示例,可以找到常见问题的解决方案,并了解最佳实践。
  7. 寻求支持:如果以上步骤仍无法解决问题,建议寻求机器学习 PAI 的技术支持。他们可以提供针对你的具体问题的进一步指导和解决方案。

需要注意的是,报错可能由于多种原因引起,因此确切的解决方法取决于具体的错误和情境。根据报错信息和上述步骤,你可以尝试定位和解决问题。



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/532883?spm=a2c6h.13066369.question.4.4d7868a2XILanO&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@532883._.ID_532883-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_1



问题三:训练的时候是没问题的,所以为什么机器学习PAI会报错?

export的时候报错AttributeError: 'module' object has no attribute 'CounterFilterOptions'https://logview.aliyun.com/logview/?h=http://service.eu-central-1.maxcompute.aliyun-inc.com/api&p=ads_fenfa_dev&i=20230506011425127gzgsfqbs1_b1aa2659_e762_4800_b218_5a6bbc6f8020&token=MGd0b0RNR3l0UWVaVEh5L3pjRUNId2s4QTZVPSxPRFBTX09CTzpwNF8yOTkwNzA2MzYzNTYyMDA2MzcsMTY4NTkyNzY3Myx7IlN0YXRlbWVudCI6W3siQWN0aW9uIjpbIm9kcHM6UmVhZCJdLCJFZmZlY3QiOiJBbGxvdyIsIlJlc291cmNlIjpbImFjczpvZHBzOio6cHJvamVjdHMvYWRzX2ZlbmZhX2Rldi9pbnN0YW5jZXMvMjAyMzA1MDYwMTE0MjUxMjdnemdzZnFiczFfYjFhYTI2NTlfZTc2Ml80ODAwX2IyMThfNWE2YmJjNmY4MDIwIl19XSwiVmVyc2lvbiI6IjEifQ== 我的config文件加了一个参数: ev_params { filter_freq: 4 } 训练的时候是没问题的,所以为什么机器学习PAI会报错?



参考答案:

这个是参数是EmbeddingVariable 的。 File "/worker/tensorflow_jobs/easy_rec/python/compat/feature_column/feature_column_v2.py", line 3646, in _get_dense_tensor weight_collections, trainable) File "/worker/tensorflow_jobs/easy_rec/python/compat/feature_column/feature_column_v2.py", line 3557, in _old_get_dense_tensor_internal extra_args['filter_options'] = variables.CounterFilterOptions( AttributeError: 'module' object has no attribute 'CounterFilterOptions' 这段有问题。所以训练用的是tensorflow1150_cpu_ext,导出也得用tensorflow1150_cpu_ext ,如果1150也还是会有同样的错,那就是EasyRec版本不一致: ads_fenfa_dev/resources/easy_rec_ext_0.6.1_res.tar.gz



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/507509?spm=a2c6h.13066369.question.5.4d7868a2DVVlNG&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@507509._.ID_507509-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_2



问题四:机器学习PAI一直报错可能是什么原因?

机器学习PAI一直报错可能是什么原因? py脚本任务,在物理机上配置的环境可以提交上去成功运行。迁移到k8s上就一直报这个错 镜像里面我装了flink1.13.2,python3和pyflink 1.5.5包,alink jar也放到flink lib目录下面了,flinkconf文件也配置了parent-first。可能是什么原因,镜像里面jdk是oracle jdk1.8



参考答案:

两边的jdk要一致



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/507399?spm=a2c6h.13066369.question.4.4d7868a24YDqfg&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@507399._.ID_507399-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_3



问题五:机器学习pai报错Error- error extract userScript: train.tar.gz

我写好了代码在自己的本机上可以运行,然后尝试了把代码打包后上传,出现下图报错

oss中文件也已经上传好了

code.tar.gz里面是把代码和数据一起打包上传的,运行也报同样的错误。下面的train.tar.gz是只有代码打包上传,结果也是同样的报错。

PAI内填写的参数如下

就是python文件填的tar.gz文件,主文件是cifar_10_multi_gpu_train.py

请问怎么处理呢?



参考答案:

把上传的文件下载下来,是正确的吗?另外,一定要用压缩的文件吗?



关于本问题的更多回答可点击进行查看:

https://developer.aliyun.com/ask/111484?spm=a2c6h.13066369.question.7.4d7868a2uGT7Z7&scm=20140722.S_community@@%E9%97%AE%E7%AD%94@@111484._.ID_111484-RL_%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0PAI%E6%8A%A5%E9%94%99-LOC_m~UND~search~UND~community~UND~i-OR_ser-V_3-P0_4

相关实践学习
使用PAI-EAS一键部署ChatGLM及LangChain应用
本场景中主要介绍如何使用模型在线服务(PAI-EAS)部署ChatGLM的AI-Web应用以及启动WebUI进行模型推理,并通过LangChain集成自己的业务数据。
机器学习概览及常见算法
机器学习(Machine Learning, ML)是人工智能的核心,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能,它是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域。 本课程将带你入门机器学习,掌握机器学习的概念和常用的算法。
相关文章
|
27天前
|
机器学习/深度学习 数据采集 人工智能
探索机器学习:从理论到Python代码实践
【10月更文挑战第36天】本文将深入浅出地介绍机器学习的基本概念、主要算法及其在Python中的实现。我们将通过实际案例,展示如何使用scikit-learn库进行数据预处理、模型选择和参数调优。无论你是初学者还是有一定基础的开发者,都能从中获得启发和实践指导。
42 2
|
1月前
|
机器学习/深度学习 数据采集 人工智能
揭秘AI:机器学习的魔法与代码
【10月更文挑战第33天】本文将带你走进AI的世界,了解机器学习的原理和应用。我们将通过Python代码示例,展示如何实现一个简单的线性回归模型。无论你是AI新手还是有经验的开发者,这篇文章都会给你带来新的启示。让我们一起探索AI的奥秘吧!
|
2月前
|
数据采集 移动开发 数据可视化
模型预测笔记(一):数据清洗分析及可视化、模型搭建、模型训练和预测代码一体化和对应结果展示(可作为baseline)
这篇文章介绍了数据清洗、分析、可视化、模型搭建、训练和预测的全过程,包括缺失值处理、异常值处理、特征选择、数据归一化等关键步骤,并展示了模型融合技术。
87 1
模型预测笔记(一):数据清洗分析及可视化、模型搭建、模型训练和预测代码一体化和对应结果展示(可作为baseline)
|
2月前
|
机器学习/深度学习 人工智能 算法
揭开深度学习与传统机器学习的神秘面纱:从理论差异到实战代码详解两者间的选择与应用策略全面解析
【10月更文挑战第10天】本文探讨了深度学习与传统机器学习的区别,通过图像识别和语音处理等领域的应用案例,展示了深度学习在自动特征学习和处理大规模数据方面的优势。文中还提供了一个Python代码示例,使用TensorFlow构建多层感知器(MLP)并与Scikit-learn中的逻辑回归模型进行对比,进一步说明了两者的不同特点。
81 2
|
2月前
|
JSON 测试技术 API
阿里云PAI-Stable Diffusion开源代码浅析之(二)我的png info怎么有乱码
阿里云PAI-Stable Diffusion开源代码浅析之(二)我的png info怎么有乱码
|
2月前
|
机器学习/深度学习 算法 API
【机器学习】正则化,欠拟合与过拟合(详细代码与图片演示!助你迅速拿下!!!)
【机器学习】正则化,欠拟合与过拟合(详细代码与图片演示!助你迅速拿下!!!)
|
3月前
|
机器学习/深度学习 人工智能 算法
探索人工智能:机器学习的基本原理与Python代码实践
【9月更文挑战第6天】本文深入探讨了人工智能领域中的机器学习技术,旨在通过简明的语言和实际的编码示例,为初学者提供一条清晰的学习路径。文章不仅阐述了机器学习的基本概念、主要算法及其应用场景,还通过Python语言展示了如何实现一个简单的线性回归模型。此外,本文还讨论了机器学习面临的挑战和未来发展趋势,以期激发读者对这一前沿技术的兴趣和思考。
|
7月前
|
机器学习/深度学习 存储 搜索推荐
利用机器学习算法改善电商推荐系统的效率
电商行业日益竞争激烈,提升用户体验成为关键。本文将探讨如何利用机器学习算法优化电商推荐系统,通过分析用户行为数据和商品信息,实现个性化推荐,从而提高推荐效率和准确性。
248 14
|
7月前
|
机器学习/深度学习 算法 数据可视化
实现机器学习算法时,特征选择是非常重要的一步,你有哪些推荐的方法?
实现机器学习算法时,特征选择是非常重要的一步,你有哪些推荐的方法?
128 1
|
7月前
|
机器学习/深度学习 算法 搜索推荐
Machine Learning机器学习之决策树算法 Decision Tree(附Python代码)
Machine Learning机器学习之决策树算法 Decision Tree(附Python代码)

相关产品

  • 人工智能平台 PAI