我正在努力寻找合适的函数,将返回指定数量的行随机拾取,没有从R语言的数据帧替换?有人能帮帮我吗?
当前回答
写一个!从JC的回答可以看出:
randomRows = function(df,n){
return(df[sample(nrow(df),n),])
}
现在,通过首先检查n是否<=nrow(df)并在出现错误时停止,使其更好。
其他回答
你可以这样做:
sample_data = data[sample(nrow(data), sample_size, replace = FALSE), ]
首先制作一些数据:
> df = data.frame(matrix(rnorm(20), nrow=10))
> df
X1 X2
1 0.7091409 -1.4061361
2 -1.1334614 -0.1973846
3 2.3343391 -0.4385071
4 -0.9040278 -0.6593677
5 0.4180331 -1.2592415
6 0.7572246 -0.5463655
7 -0.8996483 0.4231117
8 -1.0356774 -0.1640883
9 -0.3983045 0.7157506
10 -0.9060305 2.3234110
然后随机选择一些行:
> df[sample(nrow(df), 3), ]
X1 X2
9 -0.3983045 0.7157506
2 -1.1334614 -0.1973846
10 -0.9060305 2.3234110
我是R的新手,但我用的是这个简单的方法:
sample_of_diamonds <- diamonds[sample(nrow(diamonds),100),]
PS:如果它有一些我没有想到的缺点,请注意。
写一个!从JC的回答可以看出:
randomRows = function(df,n){
return(df[sample(nrow(df),n),])
}
现在,通过首先检查n是否<=nrow(df)并在出现错误时停止,使其更好。
在R中从tibble类型中选择一个随机样本:
library("tibble")
a <- your_tibble[sample(1:nrow(your_tibble), 150),]
Nrow接受一个tibble并返回行数。传递给sample的第一个参数是一个从1到tibble末尾的范围。传递给sample的第二个参数是150,表示需要多少随机抽样。方括号切片指定返回索引的行。变量“a”获取随机抽样的值。
推荐文章
- 使用pandoc从Markdown转换为PDF时设置空白大小
- 使用pandas对同一列进行多个聚合
- ggplot2折线图给出“geom_path:每组只包含一个观测值。你需要调整群体审美吗?”
- 在Python Pandas中删除多个列中的所有重复行
- 将Pandas多索引转换为列
- 熊猫数据帧得到每组的第一行
- 导入文本文件为单字符字符串
- 为什么我的熊猫'应用'功能引用多列工作?
- 如何在c++中生成一个随机数?
- 移除jupyter笔记本上的内核
- 提取一个dplyr tbl列作为向量
- 查找名称包含特定字符串的列
- 将空白值(空格)替换为pandas中的NaN
- 如何在R中绘制两个直方图?
- 显示/打印tibble的所有行(tbl_df)