Databricks宣布IP函数正式可用:地址与网段可直接关联,最低运行时标注仍需逐项核对

昨天 3阅读

2026年10月1日,Databricks宣布原生IP函数正式可用,让SQL、PySpark和Scala工作流直接处理IPv4、IPv6地址及CIDR网段。官方博文元数据标注01:46 UTC,即北京时间09:46。这次变化把常见地址解析、规范化与网段关联放进引擎,适合关注网络日志分析与数据管道维护的团队。

地址看起来像文字,查询实际是在判断范围

在网络日志中,一个字段可能是单个地址,另一张资产表却使用网段表示管理范围。判断两者关系时,比较字符串前缀并不可靠。此次公布的ip_cidr_contains可以判断一个IP或一个CIDR是否包含在另一网段内;ip_host与ip_cidr负责规范化相应表示。

例如,示意网段192.0.2.0/24包含192.0.2.15,却不包含192.0.3.15。这是地址范围关系,而不是文本长得有多像。对IPv6,同一个地址还可能有不同缩写形式;统一表示有助于汇总,但不能靠肉眼截取字符串来代替解析。这个例子说明函数用途,不是本文执行的性能测试。

Databricks宣布IP函数正式可用:地址与网段可直接关联,最低运行时标注仍需逐项核对

AI模型生成的概念插图:部分网络节点处于同一范围内,其余节点在范围外;不是实际网络拓扑、资产分布或产品界面。

无效地址需要有自己的去向

官方参考同时提供字符串与二进制表示的转换,以及遇到无效输入返回NULL的try版本。对原始日志来说,这允许流水线保留坏数据的状态,而不必让一条格式错误记录终止整批处理。实际采用时仍要明确:解析失败不是“没有风险”,也不等于记录可以直接丢弃。

本文建议分别统计正常解析、解析失败和源字段缺失三类数量。如果先把失败记录过滤掉再算覆盖率,报表可能看起来更干净,却隐藏采集端的问题。网段关联还要考虑重叠范围:同一地址可以属于多个不同长度的前缀,业务应说明保留全部匹配,还是按更具体的范围选择结果。

运行时范围与性能数字需要单独核实

截至10月2日核对,官方页面对最低版本的标注并不完全一致:函数参考页写Databricks Runtime 18.2及以上,博客摘要正文写18 LTS或更新版本,搜索摘要还保留18.3+。因此本文确认GA公告本身,但不把这些标注擅自合并成统一门槛;准备迁移的团队应核对目标运行时和所用函数的支持说明。

厂商还公布了多种表规模下的关联基准。基准结果对应其数据规模、计算配置与查询设计,不意味着任何日志查询都会按同一倍数加速。更实用的验证是选已有代表任务,对照相同输入的匹配结果、错误记录数、执行计划、耗时及计算成本,再判断替换自定义函数是否值得。

此次发布让地址语义更容易与其他业务数据共同分析。能否真正减少维护成本,还取决于团队是否保留了无效数据、重叠网段和运行时差异这些边界,而不只是把旧函数名称替换为新名称。

来源与核对时间

资料核对:2026年10月2日。本文依据公开资料整理,未安装或实测所述产品及服务。

文章版权声明:除非注明,否则均为云鹊BLOG原创文章,转载或复制请以超链接形式并注明出处。