pandas 分层按列随机抽样

最新推荐文章于 2024-08-04 20:27:41 发布

frostjsy

最新推荐文章于 2024-08-04 20:27:41 发布

阅读量588

点赞数 2

CC 4.0 BY-SA版权

分类专栏： python 文章标签： pandas

本文链接：https://blog.csdn.net/u013069552/article/details/140663681

实现一个多步骤的过程以达到根据类别分层随机抽样，然后从特定的 ID 中选取相关的样本。这涉及：

按类别分层进行随机抽样：首先，根据类别列进行分层抽样，选取一定数量的 ID。
根据选取的 ID 获取所有相关样本：从原数据集中提取包含这些 ID 的所有行。

下面的代码展示了如何用 pandas 来实现这些步骤。

import pandas as pd

# 创建一个示例 DataFrame
data = {
    'id': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20],
    'value': ['A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T'],
    'category': ['cat1', 'cat2', 'cat1', 'cat2', 'cat1', 'cat2', 'cat1', 'cat2', 'cat1', 'cat2',
                 'cat1', 'cat2', 'cat1', 'cat2', 'cat1', 'cat2', 'cat1', 'cat2', 'cat1', 'cat2']
}
df = pd.DataFrame(data)

print("原始 DataFrame:")
print(df)

def stratified_sample_ids(df, category_col, num_ids_per_category, random_state=None):
    sampled_ids = []
    for category, group in df.groupby(category_col):
        sampled_ids.extend(group['id'].sample(n=num_ids_per_catego