将时间序列pySpark数据帧拆分为测试

提问者：小点点

将时间序列pySpark数据帧拆分为测试

我有一个spark时间序列数据框。我想把它分成80-20个部分（列车测试）。由于这是一个时间序列数据帧，我不想进行随机分割。为了将第一个数据帧传递到列车中，并将第二个数据帧传递到测试中，我该如何做？

共1个答案

匿名用户

您可以使用pyspark.sql.functions.percent_rank（）获取按时间戳/日期列排序的DataFrame的百分比排名。然后选择所有具有排名的列

例如，如果您有以下数据帧：

df.show(truncate=False)
#+---------------------+---+
#|date                 |x  |
#+---------------------+---+
#|2018-01-01 00:00:00.0|0  |
#|2018-01-02 00:00:00.0|1  |
#|2018-01-03 00:00:00.0|2  |
#|2018-01-04 00:00:00.0|3  |
#|2018-01-05 00:00:00.0|4  |
#+---------------------+---+

您需要在培训集中的前4行和培训集中的最后一行。首先添加列排名：

from pyspark.sql.functions import percent_rank
from pyspark.sql import Window

df = df.withColumn("rank", percent_rank().over(Window.partitionBy().orderBy("date")))

现在使用rank将数据分为train和test：

train_df = df.where("rank <= .8").drop("rank")
train_df.show()
#+---------------------+---+
#|date                 |x  |
#+---------------------+---+
#|2018-01-01 00:00:00.0|0  |
#|2018-01-02 00:00:00.0|1  |
#|2018-01-03 00:00:00.0|2  |
#|2018-01-04 00:00:00.0|3  |
#+---------------------+---+

test_df = df.where("rank > .8").drop("rank")
test_df.show()
#+---------------------+---+
#|date                 |x  |
#+---------------------+---+
#|2018-01-05 00:00:00.0|4  |
#+---------------------+---+


		      
                相关问题
                

																                
					
										   HashSet如何提供恒定时间添加操作？
										   JavaHashMap内部数据结构在重新散列期间如何变化？
										   @BeforeClass在ktor测试类中不工作
										   Jest vanilla JavaScript JSDOM刷新失败，切换beforeAll到before每一个后的第二次测试中断
										   使用Junit重新运行失败的测试
										   共享可观察数据的正确方式和地点是什么
										   如何在角单元测试退订功能
										   RxJava：防止一个可观察对象发射，直到另一个可观察对象的数据被发射
										   Angular2/4：实时刷新数据
										   如何禁用RBP帧指针寄存器优化GCC时使用-O*？
										   ARM帧指针寄存器（r11）不断变化
										   main（）有时在x86上使用-fomit-frame指针保留帧指针
										   x86-64上C中的所有函数都需要堆栈帧吗？
										   如何在C中模拟堆栈帧？
										   Maven故障安全测试没有打印任何系统或摘要
										   JUnit测试仅在重命名测试类名时有效
										   我从Maven那里得到一个错误，说“有测试失败”，但我没有写任何测试失败
										   “mvn验证”与“mvn测试”有什么区别？
										   mvn测试vs mvn surefire：测试
										   如何在gradle的测试源代码集中包含所有src/test/资源/**和src/main/java/**/*. html？

将时间序列pySpark数据帧拆分为测试

共1个答案

相关问题

热门标签

微信关注