ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

VisiData 频率表(Frequency Table)完全指南:从分组计数到聚合透视的实战解析

VisiData 频率表(Frequency Table)完全指南:从分组计数到聚合透视的实战解析 数据分析CLI数据可视化【免费下载链接】visidataA terminal spreadsheet multitool for discovering and arranging data项目地址https://gitcode.com/gh_mirrors/vi/visidata点击查看免费下载导读频率表Frequency Table是 VisiData 中基于一列或多列对源数据进行分组、并统计每组行数的核心分析工具。本文以官方文档 docs/freq.md 为骨架结合 visidata/freqtbl.py 与 visidata/pivot.py 的源码实现系统讲解频率表的打开方式、离散/数值分箱Binning机制、聚合列、选择传播、常见选项与内部架构并给出可直接运行的实操示例帮助你用它完成数据探索、异常值清洗与统计摘要。一、频率表是什么分组与计数的数据探索工具频率表把源表source sheet的行按照一个或多个分组列groupByCols划分成若干个分箱bin然后统计每个分箱内源行的数量。每个分箱在频率表上表现为一行箱内的行数越多这一行在频率表中出现的位置就越靠前默认按 count 降序排列。透视表Pivot TableShiftW是频率表的扩展它除了按分组列分组还会依据一个**透视列pivot column**把每个组再拆成子组。官方文档明确指出本文讨论的一切内容同样适用于ShiftW打开的 PivotSheet——事实上FreqTableSheet在源码中直接继承自PivotSheet见 visidata/freqtbl.py 与 visidata/pivot.py因此频率表天然继承了透视表的行结构与聚合能力。在 VisiData 界面中频率表的每一行都对应源表的一个“值组合”bin列的构成如下列含义Key columns分组列来自被分组的源列数值分箱后的列使用RangeColumn显示范围count该 bin 内的源行数percent该 bin 占源表总行数的百分比histogram可视化的柱状条当disp_histogram设置时出现添加聚合列后自动隐藏Aggregation columns聚合列针对源列上通过设置的每个聚合器生成一列交互式教程与分步工作流请参阅 Grouping data and descriptive statistics本文侧重频率表本身的机制与配置。二、打开频率表的四种命令频率表可以从源表直接打开也可以在频率表之上继续下钻。以下命令均定义在 visidata/freqtbl.py2.1 在源表上按键命令名行为ShiftFfreq-col以当前光标所在列分组打开频率表g ShiftFfreq-keys以所有 key 列用!标记分组打开频率表若没有 key 列则报错there are no key columns to group byz ShiftFfreq-summary打开一个单行摘要频率表该行名为Selected汇总全部行与当前选中行的统计信息ShiftWpivot打开透视表按 key 列分组并对当前列做透视汇总源码中对应的命令注册为Sheet.addCommand(F, freq-col, vd.push(makeFreqTable(sheet, cursorCol)), ...) Sheet.addCommand(gF, freq-keys, vd.push(makeFreqTable(sheet, *keyCols)) if keyCols else vd.fail(...), ...) Sheet.addCommand(zF, freq-summary, vd.push(makeFreqTableSheetSummary(sheet, Column(Total, ...))), ...)其中makeFreqTable会创建一个名为{源表名}_{分组列名1-分组列名2...}_freq的FreqTableSheet见 visidata/freqtbl.py。这些命令也收录在菜单Data Frequency table current column / key columns中。2.2 在 ColumnsSheet 上在列表面板ColumnsSheet中把光标移到某一行该行代表一个源列按Enter命令freq-row即可基于该列打开频率表ColumnsSheet.addCommand(Enter, freq-row, vd.push(makeFreqTable(source[0], cursorRow)), ...)2.3 在频率表上下钻与排除按键命令名行为Enteropen-row打开源表副本仅包含当前 bin的行g Enterdive-selected打开源表副本包含所有选中 bin的行z Enterdive-except打开源表副本排除当前 bin的行gz Enterdive-except-selected打开源表副本排除选中 bin的行下钻实现的核心逻辑在FreqTableSheet.openRow()def openRow(self, row): open copy of source sheet with rows that are grouped in current row if row.sourcerows: vs copy(self.source) vs.names vs.names [vd.valueNames(row.discrete_keys, row.numeric_key)] vs.rows copy(row.sourcerows) return vs vd.warning(no source rows)注意下钻得到的 sheet 名称会带上该 bin 的值组合如benchmark_Quantity_freq且只复制了行集合源表本身不受影响。dive-except则通过exceptRows()过滤掉指定 bin 的行visidata/freqtbl.py。此外频率表还额外提供了open-preview空键在当前表旁打开一个分屏预览disp_splitwin_pct50实时显示光标所在 bin 的源行guunselect-rows取消选中当前 bin 对应的所有源行select-first在每个 bin 中选中第一条源行频率表禁用了粘贴相关按键p/P绑定为no-op因为 bin 行结构不适合粘贴操作。三、分箱Binning机制3.1 离散分箱默认默认情况下分组列中每个唯一的格式化值就是一个独立的 bin。例如对sample_data/benchmark.csv的Date列做ShiftF每个日期值都会成为一行。分箱完成后所有行按 count 降序排序源码见 visidata/freqtbl.py# if non-numeric grouping, reverse sort by count at end of load if not any(vd.isNumeric(c) for c in self.groupByCols): self._ordering [(countCol, True)]3.2 数值分箱Numeric Binning把选项options.numeric_binning设为True后数值列会被划分为区间而不是每个值一个 bin。区间以min - max的形式显示如0 - 10。这一分箱逻辑位于PivotSheet.groupRows()visidata/pivot.py要点如下options.histogram_bins控制 bin 数量。默认值为0此时 bin 数为源表行数的平方根nbins self.source.options.histogram_bins or int(len(self.source.rows) ** (1./2))。区间划分minval、maxval取自该列所有值排除 null/error每个 bin 的宽度为width (maxval - minval) / nbins生成[(minvalwidth*i, minvalwidth*(i1)) for i in range(nbins)]。所有值相同当width 0时只创建一个 bin(minval, maxval)。bin 数多于不同值个数当 bin 宽度为 1、或 bin 数超过整数取值个数时会退化为每个值一个 bindegenerateBinning路径即numericBins [(val, val) for val in sorted(set(vals))]。仅允许一个数值列被分箱若多个分组列同时开启数值分箱会直接vd.fail(only one numeric column can be binned)。数值分箱列在频率表中以RangeColumn呈现其显示格式为min - max见 visidata/pivot.py 的formatRange()。实操示例加载sample_data/benchmark.csv把Quantity设为 int#numeric_binningTrue后按ShiftFQuantity列会显示为范围区间而非每个数值一行。测试脚本 tests/numeric_binning.vd 演示的正是这一流程。3.3 错误值与空值Null 和错误值会各自得到自己的 bin错误值的 bin 显示为字符串化的错误信息如#ERR源码中的formatRange()在a is nankey and b is nankey时返回#ERR测试脚本 tests/freq-error.vd 演示了在包含错误值的test.jsonl上打开频率表并排序的完整过程聚合计算时 null 与 error 默认被排除见 visidata/aggregators.py 的getValueRows/getValues这也是测试 tests/avg-nulls.vd 验证的行为。四、聚合列把添加的聚合器带进频率表频率表最强大的能力之一是在打开前给源列添加聚合器之后每个聚合器都会成为频率表的一列按 bin 分别计算。4.1 如何添加聚合器在源表上把光标移到某列按并输入聚合器名称可输入多个空格分隔。可用聚合器定义在 visidata/aggregators.py聚合器含义min/max组内最小/最大值avg/mean算术平均值median中位数mode出现最频繁的值sum组内数值总和distinct组内不同值的个数count组内值的个数stdev标准差list把组内该列的值收集成列表keymax/keymin组内最大/最小值所在行的 keyq3/q4/q5/q10分位数组如q4生成 p25/p50/p75p10…p99指定百分位p50即中位数聚合器注册后源列的aggregators属性Column.aggregatorsproperty见 visidata/aggregators.py会记录这些聚合器在 ColumnsSheet 中也能看到该列的aggregators列并直接编辑。4.2 聚合列如何生成PivotSheet.addAggregateCols()visidata/pivot.py负责创建聚合列aggcols { sourcecol: sourcecol.aggregators for sourcecol in self.source.visibleCols if sourcecol.aggregators } or { sourcecol: [vd.aggregators[count]] for sourcecol in self.pivotCols }若源列上已设置聚合器则按{源列: [聚合器...]}建立映射若设置了透视列但没有显式聚合器透视列自动使用count聚合器无透视列时为每个源列, 聚合器组合生成一列AggrColumn列名形如{列名}_{聚合器名}如Paid_sum聚合值通过col.aggregator.aggregate(col.origCol, row.sourcerows)计算visidata/pivot.pyFreqTableSheet.loader()中addAggregateCols()与groupRows()并行执行vd.sync(...)保证交互加载流畅visidata/freqtbl.py。注意频率表加载完成后afterLoad如果列数超过groupByCols 3即存在聚合列percent与histogram列会自动隐藏visidata/freqtbl.py。聚合列也会自动开启缓存c.setCache(True)见 visidata/pivot.py。4.3 完整实战按月汇总营收结合 docs/group.md 中的示例与测试脚本 tests/monthly-revenue.vd一个“每月营收”的完整流程如下在Date列输入;并填入正则(\d/\d)用捕获组新建仅含“年/月”的列Date_re按(展开捕获组再按-隐藏Date_re与Date原始列在Date_re上按^把它重命名为Date在Paid列按$设为货币类型按添加sum聚合器光标移到Date列按ShiftF打开频率表在频率表的Date列按[升序排序时间顺序在Paid_sum列按^重命名为Revenue。最终得到按月份分组的营收汇总表。测试脚本 tests/freq-summary.vd 则演示了zF摘要选中Quantity 4的行、给Quantity加mean聚合器后按zF得到单行摘要。五、选择传播Selection Propagation与批量修正频率表与源表之间的选择是双向联动的在频率表上选中某 bin源表中对应 bin 的所有行也会被选中取消选中同理在频率表上撤销Undo选择操作源表上的选择也会一并撤销。这一联动在 visidata/freqtbl.py 中实现selectRow/unselectRow会遍历row.sourcerows逐个调用self.source.selectRow(r)/unselectRow(r)同时select/unselect/toggle/select_row/toggle_row等批量操作被覆写只创建一次撤销记录addUndoSelection()避免对源表的撤销追踪产生 O(n²) 内存开销——源码注释明确说明了这一优化动机Without this optimization, the memory use for the undo-tracking on the source sheet is O(n^2) in the number of bins selected, which can easily exceed all available memory.典型应用批量修正不一致的值。官方文档给出的建议是选中值不一致的 bin按ge统一它们修正会自动传播回源表参考 docs/edit.md 中 bulk corrections 一节。原理在于频率表的 key 列是可编辑的resetCols()为离散分组列生成的 setter 会把新值写回该 bin 的全部源行visidata/pivot.pysetterlambda col,row,val,icolnum: setitem(row.discrete_keys, i, val) and col.origcol.setValues(row.sourcerows, val)因此在频率表上修改分组列的值会同步修改源表中该 bin 内所有行的对应值。类似的“选择→过滤”工作流还有在频率表上按s/t选中感兴趣的分组回到源表q按打开仅含选中行的副本。六、选项参考Options以下选项定义在 visidata/freqtbl.py选项默认值含义options.disp_histogram■直方图histogram元素的字符options.histogram_bins0数值列的直方图 bin 数0表示自动行数的平方根options.numeric_binningFalse是否把数值列分箱为区间直方图列的实现细节HistogramColumnvisidata/freqtbl.py以count列为数据源class HistogramColumn(Column): .sourceCol is the column to be histogrammed def calcValue(col, row): histogram col.sheet.options.disp_histogram histolen col.width-2 return histogram*(histolen*col.sourceCol.getTypedValue(row)//col.largest) def updateLargest(col, row): col.largest max(col.largest, col.sourceCol.getTypedValue(row))直方条的长度 (列宽-2) × (count / 最大count)其中largest在分组过程中通过updateLargest逐步更新loader()里把HistogramColumn传给groupRows的rowfunc。测试 tests/histogram.vd 演示了开启numeric_binning后查看并隐藏 histogram 列的流程。设置方式在任意表中按CtrlEset-option输入disp_histogram、histogram_bins或numeric_binning也可以在 VisiData 启动时通过命令行参数指定例如visidata -o numeric_binningTrue sample_data/benchmark.csv七、技巧与最佳实践Tips按g freeze-sheet可以把频率表冻结成普通数据表快照便于继续编辑或另存在打开频率表之前用给源列添加聚合器即可在每个 bin 上看到汇总统计如sum、mean、median选中值不一致的 bin用ge统一后修正会传播回源表见 docs/edit.md频率表上禁用p/P粘贴bin 行的数据结构PivotGroupRow不支持常规粘贴避免误操作报错在频率表上按Enter下钻出的副本只复制行不复制列结构变更适合快速检查某个 bin 的内容。八、内部架构从行类型到关键源码文件8.1 行类型PivotGroupRow频率表/透视表的每一行都是一个PivotGroupRownamedtuple定义在 visidata/pivot.py包含四个字段序号字段含义0discrete_keys离散 key 列的格式化值元组如(2018-07-03,)1numeric_key数值分箱的范围元组(min, max)未分箱时为(0, 0)2sourcerows该组包含的源行列表3pivotrows字典{透视值: [源行列表]}用于透视表按列拆分8.2 架构要点FreqTableSheet继承自PivotSheetvisidata/freqtbl.py并额外添加count、percent、histogram三列resetCols()visidata/freqtbl.py。groupRows()遍历源行按格式化 key 值把每一行分配到对应 bin并填充sourcerows与pivotrowsvisidata/pivot.py。源码注释特意说明离散 key 用list而非 tuple 存储这样在频率表上编辑 key 值时能同步反映到源表。addAggregateCols()依据源列上的聚合器创建聚合列visidata/pivot.py。nonKeyVisibleCols决定加载后哪些列获得聚合缓存afterLoad中为AggrColumn开启缓存visidata/pivot.py。透视专用pivotrows字典记录每个组内按透视值划分的行Column.aggvalue记录某列代表哪个透视值见 visidata/pivot.py。8.3 关键源码文件文件内容visidata/freqtbl.pyFreqTableSheet、HistogramColumn、freq-col/freq-keys/freq-summary等命令visidata/pivot.pyPivotSheet、PivotGroupRow、RangeColumn、groupRows、addAggregateColsvisidata/aggregators.py全部聚合器定义、aggregate-col命令、聚合选择面板测试参考tests/目录下的 tests/numeric_binning.vd、tests/freq-error.vd、tests/freq-summary.vd、tests/histogram.vd、tests/monthly-revenue.vd 等脚本可复现本文描述的核心行为适合在本地回归验证。结语频率表是 VisiData 数据探索工作流中先分组、再计数、后聚合的核心一环ShiftF一键分组计数numeric_binning把连续数值压缩成区间聚合器让每个分组自带统计摘要双向选择传播又让它成为批量清洗数据的入口。理解了PivotGroupRow的行结构与groupRows的分箱算法你就能预测任何数据集上频率表的行为并把它与透视表ShiftW、Describe sheetShiftI组合成完整的数据分析管线。赞分享数据分析CLI数据可视化【免费下载链接】visidataA terminal spreadsheet multitool for discovering and arranging data项目地址https://gitcode.com/gh_mirrors/vi/visidata点击查看免费下载相关推荐用了九年的老Mac居然还能装新版macOS不到3步走通的0元实操用了九年的老Mac居然还能装新版macOS不到3步走通的0元实操 2015 年以前的 Mac 被官方升级名单除名了系统更新按钮直接消失。用 OpenCore操作系统固件驱动开发TanStack Table 行聚合Row Aggregation实战指南从总计、分组聚合到自定义聚合函数Vanilla 框架TanStack Table 行聚合Row Aggregation实战指南从总计、分组聚合到自定义聚合函数Vanilla 框架 本文基于 TanSta前端UI组件Vespene安全加固清单构建系统必做的10个关键安全配置Vespene安全加固清单构建系统必做的10个关键安全配置 开源构建系统 Vespene 是一款横向可扩展的 CI/CD 平台负责运行构建脚本、执行代码检出上一篇Audacity 免费音频编辑器录制、编辑、导出完整手册下一篇ipfs-deploy插件开发指南如何为项目添加自定义Pinner服务创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表