百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

一文看懂数据库服务器应该做的优化工作

nanshan 2024-10-15 11:32 14 浏览 0 评论

概述

介绍一下一般数据库服务器应该做的一些优化,这里不涉及数据库层面,只考虑服务器监控和优化方面。


1、系统层面监控

主要关注以下三点。

1.1、cpu方面:

vmstat、sar 、top+P、htop、nmon、mpstat

1.2、内存:

free 、ps -aux 、top+M

1.3、IO 设备(磁盘、网络):

iostat 、 ss 、 netstat 、 iptraf、iftop、lsof

补充:

vmstat 命令说明:

  • Procs:r 显示有多少进程正在等待 CPU 时间。b 显示处于不可中断的休眠的进程数量。在等待 I/O
  • Memory:swpd 显示被交换到磁盘的数据块的数量。未被使用的数据块,用户缓冲数据块,用于操作系统的数据块的数量
  • Swap:操作系统每秒从磁盘上交换到内存和从内存交换到磁盘的数据块的数量。s1 和 s0 最好是 0
  • Io:每秒从设备中读入 b1 的写入到设备 b0 的数据块的数量。反映了磁盘 I/O
  • System:显示了每秒发生中断的数量(in)和上下文交换(cs)的数量
  • Cpu:显示用于运行用户代码,系统代码,空闲,等待 I/O 的 CPU 时间

iostat 命令说明实例命令: iostat -dk 1 5

iostat -d -k -x 5 (查看设备使用率(%util)和响应时间(await))

  • tps:该设备每秒的传输次数。“一次传输”意思是“一次 I/O 请求”。多个逻辑请求可能会被合并为“一次 I/O 请求”。
  • iops :硬件出厂的时候,厂家定义的一个每秒最大的 IO 次数,"一次传输"请求的大小是未知的。
  • kB_read/s:每秒从设备(drive expressed)读取的数据量;
  • KB_wrtn/s:每秒向设备(drive expressed)写入的数据量;
  • kB_read:读取的总数据量;
  • kB_wrtn:写入的总数量数据量;这些单位都为 Kilobytes。

2、系统层面问题解决办法

在实际的生产中,一般认为 cpu 只要不超过 90% 都没什么问题 ,当然不排除下面这些特殊情况:

2.1、cpu 负载高,IO 负载低

  • 内存不够
  • 磁盘性能差
  • SQL 问题 ------>去数据库层,进一步排查 sql 问题
  • IO 出问题了(磁盘到临界了、raid 设计不好、raid 降级、锁、在单位时间内 tps 过高)
  • tps 过高: 大量的小数据 IO、大量的全表扫描

2.2、IO 负载高,cpu 负载低

  • 大量小的 IO 写操作:
  • autocommit ,产生大量小 IO
  • IO/PS 磁盘的一个定值,硬件出厂的时候,厂家定义的一个每秒最大的 IO 次数。
  • 大量大的 IO 写操作
  • SQL 问题的几率比较大

2.3、IO 和 cpu 负载都很高

硬件不够了或 SQL 存在问题


3、基础优化-- 硬件优化

3.1、主机方面:

  • 根据数据库类型,主机 CPU 选择、内存容量选择、磁盘选择
  • 平衡内存和磁盘资源
  • 随机的 I/O 和顺序的 I/O
  • 主机 RAID 卡的 BBU(Battery Backup Unit)关闭

3.2、cpu 的选择:

  • cpu 的两个关键因素:核数、主频
  • 根据不同的业务类型进行选择:
  • cpu 密集型:计算比较多,OLTP 主频很高的 cpu、核数还要多
  • IO 密集型:查询比较,OLAP 核数要多,主频不一定高的

3.3、内存的选择:

  • OLAP 类型数据库,需要更多内存,和数据获取量级有关。
  • OLTP 类型数据一般内存是 cpu 核心数量的 2 倍到 4 倍,没有最佳实践。

3.4、存储方面:

  • 根据存储数据种类的不同,选择不同的存储设备
  • 配置合理的 RAID 级别(raid 5、raid 10、热备盘)
  • 对与操作系统来讲,不需要太特殊的选择,最好做好冗余(raid1)(ssd、sas 、sata)

3.5、raid 卡:主机 raid 卡选择:

  • 实现操作系统磁盘的冗余(raid1)
  • 平衡内存和磁盘资源
  • 随机的 I/O 和顺序的 I/O
  • 主机 RAID 卡的 BBU(Battery Backup Unit)要关闭

3.6、网络设备方面:

使用流量支持更高的网络设备(交换机、路由器、网线、网卡、HBA 卡)

注意:以上这些规划应该在初始设计系统时就应该考虑好。


4、操作系统优化

Cpu:

基本不需要调整,在硬件选择方面下功夫即可。

内存:

基本不需要调整,在硬件选择方面下功夫即可。

SWAP:

MySQL 尽量避免使用 swap。阿里云的服务器中默认 swap 为 0

IO :

  • raid、no lvm、 ext4 或 xfs、ssd、IO 调度策略
  • Swap 调整(不使用 swap 分区)

这个参数决定了 Linux 是倾向于使用 swap,还是倾向于释放文件系统 cache。在内存紧张的情况下,数值越低越倾向于释放文件系统 cache。当然,这个参数只能减少使用 swap 的概率,并不能避免 Linux 使用 swap。

修改 MySQL 的配置参数 innodb_flush_method,开启 O_DIRECT 模式。这种情况下,InnoDB 的 buffer pool 会直接绕过文件系统 cache 来访问磁盘,但是redo log 依旧会使用文件系统 cache。值得注意的是,Redo log 是覆写模式的,即使使用了文件系统的 cache,也不会占用太多。


5、系统参数调整

Linux 系统内核参数优化:

vim /etc/sysctl.conf
 net.ipv4.ip_local_port_range = 1024 65535 # 用户端口范围
 net.ipv4.tcp_max_syn_backlog = 4096 
 net.ipv4.tcp_fin_timeout = 30 
 fs.file-max=65535 # 系统最大文件句柄,控制的是能打开文件最大数量

用户限制参数:

vim /etc/security/limits.conf 
 * soft nproc 65535
 * hard nproc 65535
 * soft nofile 65535
 * hard nofile 65535

6、不相干应用优化

业务应用和数据库应用独立,防火墙:iptables、selinux 等其他无用服务(关闭):

chkconfig --level 23456 acpid off
chkconfig --level 23456 anacron off
chkconfig --level 23456 autofs off
chkconfig --level 23456 avahi-daemon off
chkconfig --level 23456 bluetooth off
chkconfig --level 23456 cups off
chkconfig --level 23456 firstboot off
chkconfig --level 23456 haldaemon off
chkconfig --level 23456 hplip off
chkconfig --level 23456 ip6tables off
chkconfig --level 23456 iptables off
chkconfig --level 23456 isdn off
chkconfig --level 23456 pcscd off
chkconfig --level 23456 sendmail off
chkconfig --level 23456 yum-updatesd off

觉得有用的朋友多帮忙转发哦!后面会分享更多devops和DBA方面的内容,感兴趣的朋友可以关注下~

相关推荐

服务器数据恢复—Raid5数据灾难不用愁,Raid5数据恢复原理了解下

Raid5数据恢复算法原理:分布式奇偶校验的独立磁盘结构(被称之为raid5)的数据恢复有一个“奇偶校验”的概念。可以简单的理解为二进制运算中的“异或运算”,通常使用的标识是xor。运算规则:若二者值...

服务器数据恢复—多次异常断电导致服务器raid不可用的数据恢复

服务器数据恢复环境&故障:由于机房多次断电导致一台服务器中raid阵列信息丢失。该阵列中存放的是文档,上层安装的是Windowsserver操作系统,没有配置ups。因为服务器异常断电重启后,rai...

服务器数据恢复-V7000存储更换磁盘数据同步失败的数据恢复案例

服务器数据恢复环境:P740+AIX+Sybase+V7000存储,存储阵列柜上共12块SAS机械硬盘(其中一块为热备盘)。服务器故障:存储阵列柜中有磁盘出现故障,工作人员发现后更换磁盘,新更换的磁盘...

「服务器数据恢复」重装系统导致XFS文件系统分区丢失的数据恢复

服务器数据恢复环境:DellPowerVault系列磁盘柜;用RAID卡创建的一组RAID5;分配一个LUN。服务器故障:在Linux系统层面对LUN进行分区,划分sdc1和sdc2两个分区。将sd...

服务器数据恢复-ESXi虚拟机被误删的数据恢复案例

服务器数据恢复环境:一台服务器安装的ESXi虚拟化系统,该虚拟化系统连接了多个LUN,其中一个LUN上运行了数台虚拟机,虚拟机安装WindowsServer操作系统。服务器故障&分析:管理员因误操作...

「服务器数据恢复」Raid5阵列两块硬盘亮黄灯掉线的数据恢复案例

服务器数据恢复环境:HPStorageWorks某型号存储;虚拟化平台为vmwareexsi;10块磁盘组成raid5(有1块热备盘)。服务器故障:raid5阵列中两块硬盘指示灯变黄掉线,无法读取...

服务器数据恢复—基于oracle数据库的SAP数据恢复案例

服务器存储数据恢复环境:某品牌服务器存储中有一组由6块SAS硬盘组建的RAID5阵列,其中有1块硬盘作为热备盘使用。上层划分若干lun,存放Oracle数据库数据。服务器存储故障&分析:该RAID5阵...

「服务器虚拟化数据恢复」Xen Server环境下数据库数据恢复案例

服务器虚拟化数据恢复环境:Dell某型号服务器;数块STAT硬盘通过raid卡组建的RAID10;XenServer服务器虚拟化系统;故障虚拟机操作系统:WindowsServer,部署Web服务...

服务器数据恢复—RAID故障导致oracle无法启动的数据恢复案例

服务器数据恢复环境:某品牌服务器中有一组由4块SAS磁盘做的RAID5磁盘阵列。该服务器操作系统为windowsserver,运行了一个单节点Oracle,数据存储为文件系统,无归档。该oracle...

服务器数据恢复—服务器磁盘阵列常见故障表现&解决方案

RAID(磁盘阵列)是一种将多块物理硬盘整合成一个虚拟存储的技术,raid模块相当于一个存储管理的中间层,上层接收并执行操作系统及文件系统的数据读写指令,下层管理数据在各个物理硬盘上的存储及读写。相对...

「服务器数据恢复」IBM某型号服务器RAID5磁盘阵列数据恢复案例

服务器数据恢复环境:IBM某型号服务器;5块SAS硬盘组成RAID5磁盘阵列;存储划分为1个LUN和3个分区:第一个分区存放windowsserver系统,第二个分区存放SQLServer数据库,...

服务器数据恢复—Zfs文件系统下误删除文件如何恢复数据?

服务器故障:一台zfs文件系统服务器,管理员误操作删除服务器上的数据。服务器数据恢复过程:1、将故障服务器所有磁盘编号后取出,硬件工程师检测所有硬盘后没有发现有磁盘存在硬件故障。以只读方式将全部磁盘做...

服务器数据恢复—Linux+raid5服务器数据恢复案例

服务器数据恢复环境:某品牌linux操作系统服务器,服务器中有4块SAS接口硬盘组建一组raid5阵列。服务器中存放的数据有数据库、办公文档、代码文件等。服务器故障&检测:服务器在运行过程中突然瘫痪,...

服务器数据恢复—Sql Server数据库数据恢复案例

服务器数据恢复环境:一台安装windowsserver操作系统的服务器。一组由8块硬盘组建的RAID5,划分LUN供这台服务器使用。在windows服务器内装有SqlServer数据库。存储空间LU...

服务器数据恢复—阿里云ECS网站服务器数据恢复案例

云服务器数据恢复环境:阿里云ECS网站服务器,linux操作系统+mysql数据库。云服务器故障:在执行数据库版本更新测试时,在生产库误执行了本来应该在测试库执行的sql脚本,导致生产库部分表被tru...

取消回复欢迎 发表评论: