向量数据库选型与踩坑实录:Milvus vs Qdrant vs pgvector 生产横评
本文针对千万级企业 RAG 知识库场景,从写入吞吐、HNSW 索引构建、内存占用、标量过滤及运维复杂度等维度,深度横评 Milvus、Qdrant 与 pgvector,并提供 Spring Boot 3.x 实战集成方案与生产避坑指南。 ...
开源埋点分析系统能否上线?先做演示、接收、入库三层验收
开源埋点分析系统的部署不等于真实事件已入库。用 SensorFlow 的演示、许可证激活、神策 SDK 测试事件和 ClickHouse SQL,逐层验收数据链路与看板口径。 ...
读数据架构知识体系指南12数据导入方法
1. 数据采集策略 1.1. 选择合适的数据采集策略是一项重大的业务决策,它在一定程度上决定了企业用其数据进行业务决策和运营的水平 1.2. 风险很高:错误的策略可能会导致数据质量差、性能问题、成本增加,甚至违反监管合规性 1.3. 要谨慎考虑数据采集方法,不仅是技术必需,也是业务必需 2. ETL ...
读数据架构知识体系指南11数据建模方法(下)
1. Kimball模型 1.1. 更适合数据需求较简单的组织 1.2. Kimball的自底向上方法 1.2.1. 都是先将原始数据从每个OLTP源系统提取到临时关系暂存表中,不进行转换或清理 1.2.2. 数据集市通过DW总线(有时也称为信息总线)进行整合,以实现数据一致性 1.2.3. 为了在 ...
ClickHouse 漏斗 SQL 实测:毫秒事件、窗口边界与真实埋点表
用可运行的合成事件和 SensorFlow 真实事件表,验证 ClickHouse windowFunnel 的毫秒时间、严格递增、窗口边界和漏斗口径。 ...
为什么所有数据库都在用B树?5分钟让你豁然开朗
想象一下,你的数据库里有1000万条用户记录。你只想查其中一个人的信息。数据库只用了3毫秒就给出了结果。它是怎么做到的? 如果它傻乎乎地一条一条扫描过去,那可能需要好几秒甚至几分钟。但数据库不会这么干,它会用一个叫“索引”的东西。而这个索引,十有八九就是 B树。 MySQL、PostgreSQL、S ...
MySQL Router遭遇Too many open files错误引起监听端口异常案例.md
这个是几天前遇到的一个案例,MySQL Router的6446端口突然连接不上. 检查的时候,发现telnet 6446端口不通,而且MySQL Router服务正常,但是端口6446不见了.当时的现象如下所示: # netstat -ntlp | grep mysqlrouter tcp 0 0 ...
读数据架构知识体系指南10数据建模方法(上)
1. 数据建模方法 1.1. 数据建模是一种高级概念技术,用于设计数据库 1.2. 涉及识别需要存储的数据,然后创建这些数据及其之间关系的结构化表示,并将其组织成表格和列 1.3. 将这些表格和列视为数据库的逻辑表示,而存储在这些表格和列中的物理数据可以位于关系数据库产品或数据湖中 1.4. 将数据 ...
读数据架构知识体系指南09设计方法
1. 设计方法 1.1. 数据设计和数据建模是一对容易混淆的概念 1.2. 数据设计看作在建造一座城市 1.2.1. 涉及决定建筑物的位置、连接城市不同部分的道路以及交通流量的规划 1.3. 数据建模更像是在设计单个建筑物 1.3.1. 涉及决定房间的布局、房间如何连接以及每个房间的用途 2. 联机 ...
YashanDB 一把定位引起SWAP空间异常的会话和SQL语句
Oracle 运维靠 TEMP;YashanDB 中间结果换出主要落在 SWAP。SWAP 水位上涨或会话卡在 swapping vm block 时,先用 ytop -f swap.sql 收齐参数、页、水位、段与会话,再 ytop -f sql.sql 看文本和计划。文中用临时 LOB 与 HA... ...
读数据架构知识体系指南08架构设计会议
1. 架构设计会议 1.1. 架构设计会议是由技术专家主导,业务和技术利益相关者共同参与的结构化讨论 1.1.1. 其核心目的在于为特定的商业机会定义并规划收集数据解决方案的高层设计 1.2. 第一次架构设计会议是架构过程的开始,并将引发更多的讨论(很可能包括其他ADS),以支持数据解决方案项目 ...
软删除和唯一索引冲突:把 deleted_at 加进唯一索引,为什么反而不唯一了
软删除(逻辑删除)和唯一索引放在同一张表上,几乎是每个后端项目都会遇到的冲突:用户注销了账号,过两天想用同一个邮箱重新注册,结果插入报 Duplicate entry。因为那条"已删除"的记录还在表里,唯一索引可不管它删没删。 网上最常见的解法是"把 deleted_at 加进唯一索引"。这个解法有 ...
读数据架构知识体系指南07大数据
1. 大数据 1.1. 构建数据架构的公司数量在21世纪20年代出现了爆炸式增长 1.1.1. 主要原因是现在可用的数据比以往任何时候都多,数据可能来自社交媒体、物联网(IoT)设备、内部应用程序和第三方软件等 1.2. 在整个商业世界,企业都在争分夺秒地建立数据架构 1.2.1. 核心在于,在正确 ...
[20260925]21c数字对象是什么(补充).txt
[20260925]21c数字对象是什么(补充).txt--//2024年8月事情记得第1次在21c跟踪执行sql语句library cache lock/library cache pin,有点点吃惊.直到现在不理解,现在大部分--//数字对象都知道来自那里,前段时间写了[20260901]表ex ...
游标分页改完反而慢了一倍:OR 展开和行值比较差了三个数量级
列表页翻到很后面越来越慢,是 LIMIT ... OFFSET ... 分页最常见的毛病。标准答案大家都知道:换成游标分页(keyset pagination)。 但我这次在本机实测时踩了一个坑:照着网上最常见的写法改成游标分页,深页反而比 OFFSET 还慢一倍。这篇把测量过程和原因都摊开,代码是 ...
读数据架构知识体系指南06数据处理
1. 主数据管理 1.1. 存储数据只是解决问题的一部分 1.2. 主数据管理(MDM)可以理解为一套技术、工具和流程,使用户能够创建和维护一致且准确的主数据列表 1.3. 涉及从内部和外部数据源及应用程序中为业务中的每个人、地点或事物创建单一的主记录 1.4. 可以使用这些主记录来构建更准确的报告 ...
读数据架构知识体系指南05数据存储
1. 数据存储 1.1. 在数字时代,数据已成为组织的血液 1.1.1. 仅仅拥有数据是不够的 1.1.2. 如何有效地管理、存储和处理这些数据才是真正的价值所在 1.2. 数据管理的各个组件就像复杂机器中的齿轮,每个组件都发挥着独特的作用,但它们又协同工作以实现共同的目标 1.3. 虽然数据集市提 ...
在 DuckDB 中执行假设检验
你有没有想过,用 SQL 就能做假设检验? 今天我们就来聊聊,如何用 DuckDB 快速完成数据分析中的两个经典任务: 对分类变量做卡方检验 对连续变量做相关性分析 整个流程非常丝滑: 用 DuckDB 直接读取 CSV 或 Parquet 文件 用熟悉的 SQL 做聚合计算 把精简后的结果交给 P ...
使用 DuckDB 计算描述性统计量
大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数 ...
读数据架构知识体系指南04数据湖(下)
1. 数据湖设计的最佳实现方案 1.1. 设计数据湖应该是一个耗时的过程 1.1.1. 通常公司在设计数据湖时没有花足够的时间考虑所有用例,后来不得不重新设计和重建 1.1.2. 公司必须仔细考虑现在和将来使用的所有数据源,并了解数据的大小、类型和速度 1.1.3. 尽可能多地了解有关数据湖设计的信 ...


