将每个列表值映射到其相应的百分位数

我认为您的示例输入/输出与典型的百分位数计算方法不符。如果将百分位数计算为“数据点的比例严格小于此值”，则最高值应为0.8（因为5个值中的4个小于最大值）。如果您将其计算为“小于或等于此值的数据点百分比”，则最低值应为0.2（因为5个值中的1个等于最小值）。因此，百分位数将为[0, 0.2, 0.4, 0.6, 0.8]或[0.2, 0.4, 0.6, 0.8, 1]。您的定义似乎是“数据点的数量严格小于该值，被视为不等于该值的数据点的数量的比例”，但是根据我的经验，这不是一个常见的定义（例如参见Wikipedia）。

使用典型的百分位数定义，数据点的百分位数等于其等级除以数据点的数量。（例如，请参阅Stats SE上的此问题，询问如何在R中执行相同的操作。）如何计算百分位数与在计算排名（例如，对绑定值进行排名）上存在差异。该scipy.stats.percentileofscore函数提供了四种计算百分位数的方法：

>>> x = [1, 1, 2, 2, 17]
>>> [stats.percentileofscore(x, a, 'rank') for a in x]
[30.0, 30.0, 70.0, 70.0, 100.0]
>>> [stats.percentileofscore(x, a, 'weak') for a in x]
[40.0, 40.0, 80.0, 80.0, 100.0]
>>> [stats.percentileofscore(x, a, 'strict') for a in x]
[0.0, 0.0, 40.0, 40.0, 80.0]
>>> [stats.percentileofscore(x, a, 'mean') for a in x]
[20.0, 20.0, 60.0, 60.0, 90.0]

（我使用包含关系的数据集来说明在这种情况下会发生什么。）

“等级”方法为联系组分配的等级等于他们将覆盖的等级的平均值（即，第二名的三路并列获得3的等级，因为它“占据”了等级2、3和4）。“弱”方法根据小于或等于给定点的数据点的比例分配百分位数；“严格”是相同的，但计数点的比例严格小于给定点。“均值”方法是后两者的平均值。

正如Kevin H. Lin指出的那样，percentileofscore循环调用效率很低，因为它必须在每次通过时重新计算排名。但是，可以使用提供的不同排名方法轻松地复制这些百分比计算scipy.stats.rankdata，让您一次计算所有百分比：

>>> from scipy import stats
>>> stats.rankdata(x, "average")/len(x)
array([ 0.3,  0.3,  0.7,  0.7,  1. ])
>>> stats.rankdata(x, 'max')/len(x)
array([ 0.4,  0.4,  0.8,  0.8,  1. ])
>>> (stats.rankdata(x, 'min')-1)/len(x)
array([ 0. ,  0. ,  0.4,  0.4,  0.8])

在最后一种情况下，将排名降低1，以使排名从0开始而不是从1开始。（我省略了“均值”，但是可以通过对后两种方法的结果求平均值来轻松获得。）

我做了一些时间。对于像您的示例这样的小数据，使用rankdata的速度要比Kevin H. Lin的解决方案要慢一些（大概是由于将东西转换成幕后的numpy数组会产生开销），但比像调用percentileofscorereptilicus的那样循环调用要快：

In [11]: %timeit [stats.percentileofscore(x, i) for i in x]
1000 loops, best of 3: 414 µs per loop

In [12]: %timeit list_to_percentiles(x)
100000 loops, best of 3: 11.1 µs per loop

In [13]: %timeit stats.rankdata(x, "average")/len(x)
10000 loops, best of 3: 39.3 µs per loop

但是，对于大型数据集，numpy的性能优势会生效，使用rankdata速度比Kevin快10倍list_to_percentiles：

In [18]: x = np.random.randint(0, 10000, 1000)

In [19]: %timeit [stats.percentileofscore(x, i) for i in x]
1 loops, best of 3: 437 ms per loop

In [20]: %timeit list_to_percentiles(x)
100 loops, best of 3: 1.08 ms per loop

In [21]: %timeit stats.rankdata(x, "average")/len(x)
10000 loops, best of 3: 102 µs per loop

这种优势只会在越来越大的数据集上变得更加明显。

其他 2022/1/1 18:46:36 有463人围观

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节

关注并接收问题和回答的更新提醒

参与内容的编辑和改进，让解决方法与时俱进

请先登录

将每个列表值映射到其相应的百分位数

撰写回答

推荐问题

如何将每个单词的首字母大写，例如2单词的城市？[重复]

numpy：将每行的max更改为1，所有其他数字更改为0

SQL Server：用“ /”分割字符串，并将每个分割元素放入不同的列中

将每个SQL查询记录到Rails中的数据库

从txt文件中仅读取整数并将每个发现的值相加

PMD将每个循环的Java标记为UR异常

将每个项目与ArrayList中的每个其他项目进行比较

numpy：将每行除以一个向量元素

在SQL Server中将字符串拆分为最大长度，并将每个字符串作为一行返回

将每隔一行移到新列并分组pandas python

通过Python中的pandas将每日库存数据转换为基于每周的数据

cx_Oracle：如何将每一行作为字典接收？

如何将每个包含一组子命令的Click命令拆分为多个文件？

将每一行的值除以该列的SUM

将一组数字转换为numpy，以便将每个数字转换为小于该数字的其他数字

将每个值都放在pandas的百分比中

将每个值加到元组列表中

将每个字典值转换为utf-8（字典理解力？）

将每个列表值映射到其相应的百分位数

将每个SQL查询记录到Rails 3中的数据库

分类汇总

您的鼓励是对我最大的支持