MTBF,即平均故障间隔时间,英文全称是“Mean Time Between Failure”。是衡量一个产品(尤其是电器产品)的可靠性指标。单位为“小时”。它反映了产品的时间质量,是体现产品在规定时间内保持功能的一种能力。具体来说,是指相邻两次故障之间的平均工作时间,也称为平均故障间隔。概括地说,产品故障少的就是可靠性高,产品的故障总数与寿命单位总数之比叫“故障率”(Failure rate)。它仅适用于可维修产品。同时也规定产品在总的使用阶段累计工作时间与故障次数的比值为MTBF。磁盘阵列产品一般MTBF不能低于50000小时。
计算方法
失效时间是指上一次设备恢复正常状态(图中的up time)起,到设备此次失效那一刻(图中的down time)之间间隔的时间。
MTBF值是产品设计时要考虑的重要参数,可靠度工程师或设计师经常使用各种不同的方法与标准来估计产品的MTBF值。相关标准包括MIL-HDBK-217F、Telcordia SR332、Siemens Norm、Fides或UTE CRDF2000)等。不过这些方法估计到的值和实际的平均故障间隔仍有相当的差距。计算平均故障间隔的目的是为了找出设计中的薄弱环节。
故障时间
随着服务器的广泛应用,对服务器的可靠性提出了更高的要求。所谓“可靠性”,就是产品在规定条件下和规定时间内完成规定功能的能力;反之,产品或其一部分不能或将不能完成规定的功能是出故障。概括地说,产品故障少的就是可靠性高,产品的故障总数与寿命单位总数之比叫“故障率”(Failure rate),常用λ表示。例如正在运行中的100只硬盘,一年之内出了2次故障,则每个硬盘的故障率为0.02次/年。当产品的寿命服从指数分布时,其故障率的倒数就叫做平均故障间隔时间(Mean Time Between Failures),简称MTBF。即:
MTBF=1/λ
笔者看到一款可用于服务器的WD Caviar RE2 7200 RPM 硬盘,MTBF 高达 120万小时,保修 5年。120万小时约为137年,并不是说该种硬盘每只均能工作137年不出故障。由MTBF=1/λ可知λ=1/MTBF=1/137年,即该硬盘的平均年故障率约为0.7%,一年内,平均1000只硬盘有7只会出故障。
下图所示为著名的浴盆曲线,左边斜线部分为早期故障率,其故障率一般较高且随着时间推移很快下降。曲线中部为使用寿命期,其故障率一般很低且基本固定。最右部为耗损期,失效率急速升高。电子产品制造商一般通过测试、老炼、筛选等手段将早期故障尽量剔除,然后提供给客户使用。当使用寿命期将尽,产品也即将进入故障高发期,需要报废或更新换代了。
由来
右图为浴盆曲线 [1] ,那么浴盆曲线与产品寿命有什么关系呢?
电子产品的寿命一般都符合浴盆曲线,可分为三个阶段:
1.早夭期:由于设计,原材料,生产等可能出现的原因而导致一个较高失效率的阶段,也称失效率递减阶段,可通过环境应力筛选加以剔除,保证产品的可靠性。
2.稳定期:这一阶段产品失效率近似一个常数,只有随机失效产生,MTBF即要得到这一阶段的寿命。
3.耗损期:硬件故障期,产品这时已达到设计寿命,进入报废阶段。
寿命
明白了MTBF和“浴盆”曲线的基本概念,我们对评估产品的使用寿命有了一定的掌握。在合适工作条件下器件使用寿命期内的故障率很低。广大电子爱好者都知道电子元器件的寿命,与工作温度是有密切关系的。以电脑主板上常用的也常出故障的电解电容器为例,其寿命会受到温度的影响。因此,应尽可能使电容器在较低的温度之下工作,如果电容器的实际工作温度超过了其规格范围,不仅其寿命会缩短,而且电容器会受到严重的损毁(例如电解液泄漏)。因此,在分析电脑主板上电容器的工作温度时,不仅要考虑机箱内整体环境温度及电容器自身的发热,还要考虑机箱内其他发热元件的热辐射(特别是CPU、稳压器、电源供应器等)。
根据测试,通常2.0G的CPU消耗功率达56.7W,生成温度达70℃;而当频率提高至3.0G时, CPU温度往往超过90℃。在这样的高温烘烤下,主板上的电容器寿命会发生什么变化?
为简化起见,不考虑纹波、频率、ESR等因素,电容器的估计寿命可用下述公式表示:
其中,L0表示工作温度下的寿命,Tmax表示工作温度,Ta表示实际环境温度。由此可见,如果环境温度每升高10℃,电容器寿命将下降一倍!
由上图右面的曲线可明显看出,随着电容器工作环境温度的上升,其有效寿命急剧缩短。其中有效寿命(Useful life)是指该种电容器达到给定故障率的时间。
电脑的关系
可靠性
电源供应器对电脑来说,重要性不言而喻。影响电源供应器寿命的因素很多,如负载大小、振动和周边的环境温度等。其中,环境温度很重要,所以选择合适的风扇,排放出由电源供应器内部的热量非常关键。电源供应器的MTBF,在很大程度上是由其内部的电解电容器MTBF值所决定的。因随着温度的上升,电容器的寿命急剧缩短,所以电源供应器的工作温度如能得到降低,其寿命就会更长一些。
当评价电源供应器所标称寿命时,电源供应器是否运行在额定的满负载状况是另一重要考虑因素。如果电源供应器装有合适的散热器而散热风扇风量足够大,在低于满负载的情况下连续工作,电源供应器就能有更长的寿命。一般电脑电源供应器寿命按照3-5年计算元件的可能失效周期,MTBF在0小时之间。
不同的电源供应器厂家,其产品设计、用料也往往差别很大,工作寿命自然不同。
除电源供应器外,硬碟的温度也不可小视。硬碟动不动就7200rpm-15000rpm,想想看硬碟内的马达每天转24小时,平均工作温度在四、五十度的高热是免不了。笔者曾测量过一台散热不够好的伺服器硬碟,温度超过40℃。对硬碟来说,如果机壳内部的温度降低了,这将意味着减少主轴马达液态轴承的轴承润滑剂以及磁碟润滑剂的蒸发,这将大大降低其损坏的机率。据Seagate公司公开的某型号硬碟数据,在34℃时的MTBF为150,000小时,但在25℃时,会达到230,000小时。
散热效果
为降低硬碟温度,可增加散热风扇。市面上是有卖硬碟专用的散热模组,有的则是一颗风扇再加上一块硬碟大小的铝制散热片,其实没有必要这么复杂。
如采用小型风鼓(BLOWER),风量增加,散热效果更好。但是,增加风扇或风鼓一定要考虑振动的问题。要知道风扇较高的转速才能达到一定的风量,但如采用较劣质的风扇,转速虽高,但寿命短且振动厉害,对硬碟寿命会带来不利影响,安装硬碟时加吸震软垫、机箱机壳底部的吸震片都有一定效用。
优质的电源供应器当然要搭配高品质的风扇,如HG2-6400P选用的是NMB钢珠轴承风扇,比传统油封轴承风扇寿命高出2倍。这款电源供应器还加入了风扇转速控制线路,可以根据电源内部的温度调节风扇转速,在延长使用寿命的同时,也更好的控制了风扇噪音和震动。
影响
如何保养和维护好伺服器,限度的延长其使用寿命,是大家都非常关心的话题。灰尘对伺服器构成的威胁不容忽视。按笔者的电子产品维修经验,在灰尘比较大的环境中工作,由于PCB吸附灰尘,而灰尘的沉积会影响电子元器件的热量散发,这将导致元件温度上升,进而出现热稳定性下降甚至产生漏电,严重时导致烧毁。另外,灰尘也会吸收水分,腐蚀电子线路,造成一些莫名其妙的短路问题。所以灰尘体积虽小,但对伺服器的危害不可低估。
尽管伺服器机房有相对较好的环境,但灰尘仍会不断累积。所以,有必要定期进行清理,可使用上图美国生产CRC牌防尘喷剂、也可用有防静电(ESD)功能的小毛刷小心进行清扫,或使用吹风球清洁灰尘,减少出故障的机率。在清理机箱内部的灰尘时,切记断开电源,小心操作,特别是面板进风口和电源(排风口)的附近,以及板卡的插接部位灰尘。清理电源里的灰尘将电源供应器拆下,用防尘喷剂、吹气球仔细清扫干净后再装回。
计算
设有一个可修复的产品在使用过程中,共计发生过N0次故障,每次故障后经过修复又和新的一样继续投入使用,其工作时间分别为:T0,T1。那么产品的平均故障间隔时间,也就是平均寿命为Q为:(T0+T1)/N0。
通常,我们在产品的手册或包装上能够看到这个MTBF值,如8000小时,2万小时,那么,MTBF的数值是怎样算出来的呢,假设一台电脑的MTBF 为3万小时,是不是把这台电脑连续运行3万小时检测出来的呢?答案是否定的,如果是那样的话,我们有那么多产品要用几十年都检测不完的。其实,关于 MTBF值的计算方法,目前用的权威性标准是MIL-HDBK-217、GJB/Z299B和Bellcore,分别用于军工产品和民用产品。其中,MIL-HDBK-217是由美国国防部可靠性分析中心及Rome实验室提出并成为行业标准,专门用于军工产品MTBF值计算,GJB/Z299B是我国军用标准;而Bellcore是由AT&TBell实验室提出并成为商用电子产品MTBF值计算的行业标准。
MTBF计算中主要考虑的是产品中每个器件的失效率。但由于器件在不同的环境、不同的使用条件下其失效率会有很大的区别,例如,同一产品在不同的环境下,如在实验室和海洋平台上,其可靠性值肯定是不同的;又如一个额定电压为16V的电容在实际电压为25V和5V下的失效率肯定是不同的。所以,在计算可靠性指标时,必须考虑上述多种因素。所有上述这些因素,几乎无法通过人工进行计算,但借助于软件如MTBFcal软件和其庞大的参数库,我们就能够轻松的得出MTBF值。
深圳市讯科标准技术服务有限公司作为独立第三方检测机构,以公正、权威的非当事人身份,根据有关法律、标准或合同所进行的商品检验活动。将长期致力于为多领域客户提供一站式检测服务及绿色解决方案,凭借精确、高效、专业的检测服务,协助企业全面提升产品品质!
深圳市讯科标准服务宗旨:
我们秉承科学严谨的工作态度,为客户提供快捷、公正、权威、国际的第三方咨询,检测,认证服务。
高效------合理安排测试时间,统筹安排测试计划,竭力缩短测试时间和认证周期,以客户为中心,提供快速的认证服务
如需更多的咨询项目,深圳市讯科标准技术服务有限公司随时欢迎您前来咨询!
业务咨询:0755-23312011/ 18165787025 (微信同号)
统一客服热线:400 0199 838 邮箱:CS@xktest.cn
联系人:尹先生
地址:深圳市宝安区航城街道九围社区强荣东工业区E2栋2楼