详解Java分布式事务的 6 种解决方案


Posted in Java/Android onJune 26, 2021

介绍

在分布式系统、微服务架构大行其道的今天,服务间互相调用出现失败已经成为常态。如何处理异常,如何保证数据一致性,成为微服务设计过程中,绕不开的一个难题。 在不同的业务场景下,解决方案会有所差异,常见的方式有:

  1. 阻塞式重试;
  2. 2PC、3PC 传统事务;
  3. 使用队列,后台异步处理;
  4. TCC 补偿事务;
  5. 本地消息表(异步确保);
  6. MQ 事务。

本文侧重于其他几项,关于 2PC、3PC 传统事务,网上资料已经非常多了,这里不多做重复。

阻塞式重试

在微服务架构中,阻塞式重试是比较常见的一种方式。伪代码示例:

m := db.Insert(sql)

err := request(B-Service,m)

func request(url string,body interface{}){
  for i:=0; i<3; i ++ {
    result, err = request.POST(url,body)
    if err == nil {
        break 
    }else {
      log.Print()
    }
  }
}

如上,当请求 B 服务的 API 失败后,发起最多三次重试。如果三次还是失败,就打印日志,继续执行下或向上层抛出错误。这种方式会带来以下问题

  1. 调用 B 服务成功,但由于网络超时原因,当前服务认为其失败了,继续重试,这样 B 服务会产生 2 条一样的数据。
  2. 调用 B 服务失败,由于 B 服务不可用,重试 3 次依然失败,当前服务在前面代码中插入到 DB 的一条记录,就变成了脏数据。
  3. 重试会增加上游对本次调用的延迟,如果下游负载较大,重试会放大下游服务的压力。

第一个问题:通过让 B 服务的 API 支持幂等性来解决。

第二个问题:可以通过后台定时脚步去修正数据,但这并不是一个很好的办法。

第三个问题:这是通过阻塞式重试提高一致性、可用性,必不可少的牺牲。

阻塞式重试适用于业务对一致性要求不敏感的场景下。如果对数据一致性有要求的话,就必须要引入额外的机制来解决。

异步队列

在解决方案演化的过程中,引入队列是个比较常见也较好的方式。如下示例:

m := db.Insert(sql)

err := mq.Publish("B-Service-topic",m)

在当前服务将数据写入 DB 后,推送一条消息给 MQ,由独立的服务去消费 MQ 处理业务逻辑。和阻塞式重试相比,虽然 MQ 在稳定性上远高于普通的业务服务,但在推送消息到 MQ 中的调用,还是会有失败的可能性,比如网络问题、当前服务宕机等。这样还是会遇到阻塞式重试相同的问题,即 DB 写入成功了,但推送失败了。

理论上来讲,分布式系统下,涉及多个服务调用的代码都存在这样的情况,在长期运行中,调用失败的情况一定会出现。这也是分布式系统设计的难点之一。

TCC 补偿事务

在对事务有要求,且不方便解耦的情况下,TCC 补偿式事务是个较好的选择。

TCC 把调用每个服务都分成 2 个阶段、 3 个操作:

  • 阶段一、Try 操作:对业务资源做检测、资源预留,比如对库存的检查、预扣。
  • 阶段二、Confirm 操作:提交确认 Try 操作的资源预留。比如把库存预扣更新为扣除。
  • 阶段二、Cancel 操作:Try 操作失败后,释放其预扣的资源。比如把库存预扣的加回去。

TCC 要求每个服务都实现上面 3 个操作的 API,服务接入 TCC 事务前一次调用就完成的操作,现在需要分 2 阶段完成、三次操作来完成。

比如一个商城应用需要调用 A 库存服务、B 金额服务、C 积分服务,如下伪代码:

m := db.Insert(sql)
aResult, aErr := A.Try(m)
bResult, bErr := B.Try(m)
cResult, cErr := C.Try(m)
if cErr != nil {
    A.Cancel()
    B.Cancel()
	C.Cancel()
} else {
    A.Confirm()
    B.Confirm()
    C.Confirm()
}

代码中分别调用 A、B、C 服务 API 检查并保留资源,都返回成功了再提交确认(Confirm)操作;如果 C 服务 Try 操作失败后,则分别调用 A、B、C 的 Cancel API 释放其保留的资源。

TCC 在业务上解决了分布式系统下,跨多个服务、跨多个数据库的数据一致性问题。但 TCC 方式依然存在一些问题,实际使用中需要注意,包括上面章节提到的调用失败的情况。

空释放

上面代码中如果 C.Try() 是真正调用失败,那下面多余的 C.Cancel() 调用会出现释放并没有锁定资源的行为。这是因为当前服务无法判断调用失败是不是真的锁定 C 资源了。如果不调用,实际上成功了,但由于网络原因返回失败了,这会导致 C 的资源被锁定,一直得不到释放。

空释放在生产环境经常出现,服务在实现 TCC 事务 API 时,应支持空释放的执行。

时序

上面代码中如果 C.Try() 失败,接着调用 C.Cancel() 操作。因为网络原因,有可能会出现 C.Cancel() 请求会先到 C 服务,C.Try() 请求后到,这会导致空释放问题,同时引起 C 的资源被锁定,一直得不到释放。

所以 C 服务应拒绝释放资源之后的 Try() 操作。具体实现上,可以用唯一事务ID来区分第一次 Try() 还是释放后的 Try()。

调用失败

Cancel 、Confirm 在调用过程中,还是会存在失败的情况,比如常见的网络原因。

Cancel() 或 Confirm() 操作失败都会导致资源被锁定,一直得不到释放。这种情况常见解决方案有:

阻塞式重试。但有同样的问题,比如宕机、一直失败的情况。写入日志、队列,然后有单独的异步服务自动或人工介入处理。但一样会有问题,写日志或队列时,会存在失败的情况。

理论上来讲非原子性、事务性的二段代码,都会存在中间态,有中间态就会有失败的可能性。

本地消息表

本地消息表最初是 ebay 提出的,它让本地消息表与业务数据表处于同一个数据库中,这样就能利用本地事务来满足事务特性。

具体做法是在本地事务中插入业务数据时,也插入一条消息数据。然后在做后续操作,如果其他操作成功,则删除该消息;如果失败则不删除,异步监听这个消息,不断重试。

本地消息表是一个很好的思路,可以有多种使用方式:

配合MQ

示例伪代码:

messageTx := tc.NewTransaction("order")
messageTxSql := tx.TryPlan("content")

m,err := db.InsertTx(sql,messageTxSql)
if err!=nil {
	return err
}

aErr := mq.Publish("B-Service-topic",m)
if aErr!=nil { // 推送到 MQ 失败
	messageTx.Confirm() // 更新消息的状态为 confirm
}else {
	messageTx.Cancel() // 删除消息
}

// 异步处理 confirm 的消息,继续推送
func OnMessage(task *Task){
   err := mq.Publish("B-Service-topic", task.Value())
   if err==nil {
     messageTx.Cancel()
   }
}

上面代码中其 messageTxSql 是插入本地消息表的一段 SQL :

insert into `tcc_async_task` (`uid`,`name`,`value`,`status`) 
values ('?','?','?','?')

它和业务 SQL 在同一个事务中去执行,要么成功,要么失败。

成功则推送到队列,推送成功,则调用 messageTx.Cancel() 删除本地消息;推送失败则标记消息为 confirm。本地消息表中 status 有 2 种状态 tryconfirm, 无论哪种状态在 OnMessage 都可以监听到,从而发起重试。

本地事务保障消息和业务一定会写入数据库,此后的执行无论宕机还是网络推送失败,异步监听都可以进行后续处理,从而保障了消息一定会推到 MQ。

而 MQ 则保障一定会到达消费者服务中,利用 MQ 的 QOS 策略,消费者服务一定能处理,或继续投递到下一个业务队列中,从而保障了事务的完整性。

配合服务调用

示例伪代码:

messageTx := tc.NewTransaction("order")
messageTxSql := tx.TryPlan("content")

body,err := db.InsertTx(sql,messageTxSql)
if err!=nil {
    return err
}

aErr := request.POST("B-Service",body)
if aErr!=nil { // 调用 B-Service 失败
	messageTx.Confirm() // 更新消息的状态为 confirm
}else {
	messageTx.Cancel() // 删除消息
}

// 异步处理 confirm 或 try 的消息,继续调用 B-Service 
func OnMessage(task *Task){
  // request.POST("B-Service",body)
}

这是本地消息表 + 调用其他服务的例子,没有 MQ 的引入。这种使用异步重试,并用本地消息表保障消息的可靠性,解决了阻塞式重试带来的问题,在日常开发中比较常见。

如果本地没有要写 DB 的操作,可以只写入本地消息表,同样在 OnMessage中处理:

messageTx := tc.NewTransaction("order")
messageTx := tx.Try("content")
aErr := request.POST("B-Service",body)
// ....

消息过期

配置本地消息表的 TryConfirm 消息的处理器:

TCC.SetTryHandler(OnTryMessage())
TCC.SetConfirmHandler(OnConfirmMessage())

在消息处理函数中要判断当前消息任务是否存在过久,比如一直重试了一小时,还是失败,就考虑发邮件、短信、日志告警等方式,让人工介入。

func OnConfirmMessage(task *tcc.Task) {
if time.Now().Sub(task.CreatedAt) > time.Hour {
    err := task.Cancel()  // 删除该消息,停止重试。
   // doSomeThing() 告警,人工介入
    return
 }
}

Try 处理函数中,还要单独判断当前消息任务是否存在过短,因为 Try状态的消息,可能才刚刚创建,还没被确认提交或删除。这会和正常业务逻辑的执行重复,意味着成功的调用,也会被重试;为尽量避免这种情况,可以检测消息的创建时间是否很短,短的话可以跳过。

重试机制必然依赖下游 API 在业务逻辑上的幂等性,虽然不处理也可行,但设计上还是要尽量避免干扰正常的请求。

独立消息服务

独立消息服务是本地消息表的升级版,把本地消息表抽离成一个独立的服务。所有操作之前先在消息服务添加个消息,后续操作成功则删除消息,失败则提交确认消息。

然后用异步逻辑去监听消息,做对应的处理,和本地消息表的处理逻辑基本一致。但由于向消息服务添加消息,无法和本地操作放到一个事务里,所以会存在添加消息成功,后续失败,则此时的消息就是个无用消息。

如下示例场景:

err := request.POST("Message-Service",body)
if err!=nil {
  return err
}
aErr := request.POST("B-Service",body)
if aErr!=nil {
  return aErr
}

这个无用的消息,需要消息服务去确认这个消息是否执行成功,没有则删除,有继续执行后续逻辑。相比本地事务表 tryconfirm ,消息服务在前面多了一种状态 prepare

MQ 事务

有些 MQ 的实现支持事务,比如 RocketMQ 。MQ 的事务可以看作独立消息服务的一种具体实现,逻辑完全一致。

所有操作之前先在 MQ 投递个消息,后续操作成功则 Confirm 确认提交消息,失败则Cancel删除消息。MQ 事务也会存在 prepare状态,需要 MQ 的消费处理逻辑来确认业务是否成功。

总结

从分布式系统实践中来看,要保障数据一致性的场景,必然要引入额外的机制处理。

TCC 的优点是作用于业务服务层,不依赖某个具体数据库、不与具体框架耦合、资源锁的粒度比较灵活,非常适用于微服务场景下。缺点是每个服务都要实现 3 个 API,对于业务侵入和改动较大,要处理各种失败异常。开发者很难完整处理各种情况,找个成熟的框架可以大大降低成本,比如阿里的 Fescar。

本地消息表的优点是简单、不依赖其他服务的改造、可以很好的配合服务调用和 MQ 一起使用,在大多业务场景下都比较实用。缺点是本地数据库多了消息表,和业务表耦合在一起。文中本地消息表方式的示例,来源于作者写的一个库,有兴趣的同学可以参考下 https://github.com/mushroomsir/tcc

MQ 事务和独立消息服务的优点是抽离出一个公共的服务来解决事务问题,避免每个服务都有消息表和服务耦合在一起,增加服务自身的处理复杂性。缺点是支持事务的 MQ 很少;且每次操作前都先调用 API 添加个消息,会增加整体调用的延迟,在绝大多数正常响应的业务场景下,是一种多余的开销。

TCC 参考:https://www.sofastack.tech/blog/seata-tcc-theory-design-realization/

MQ 事务参考:https://www.jianshu.com/p/eb571e4065ec

到此这篇关于详解Java分布式事务的 6 种解决方案的文章就介绍到这了,更多相关java分布式事务内容请搜索三水点靠木以前的文章或继续浏览下面的相关文章希望大家以后多多支持三水点靠木!

Java/Android 相关文章推荐
Java循环队列与非循环队列的区别总结
Jun 22 Java/Android
解决Swagger2返回map复杂结构不能解析的问题
Jul 02 Java/Android
spring cloud gateway中如何读取请求参数
Jul 15 Java/Android
使用logback实现按自己的需求打印日志到自定义的文件里
Aug 30 Java/Android
springboot新建项目pom.xml文件第一行报错的解决
Jan 18 Java/Android
关于Mybatis中SQL节点的深入解析
Mar 19 Java/Android
Spring Data JPA框架自定义Repository接口
Apr 28 Java/Android
java版 联机五子棋游戏
May 04 Java/Android
解决Springboot PostMapping无法获取数据的问题
May 06 Java/Android
JAVA springCloud项目搭建流程
May 11 Java/Android
前端与RabbitMQ实时消息推送未读消息小红点实现示例
Jul 23 Java/Android
Spring boot实现上传文件到本地服务器
Aug 14 Java/Android
自从在 IDEA 中用了热部署神器 JRebel 之后,开发效率提升了 10(真棒)
图解排序算法之希尔排序Java实现
Netty结合Protobuf进行编解码的方法
Java常用工具类汇总 附示例代码
Java多条件判断场景中规则执行器的设计
Java基于字符界面的简易收银台
springboot集成flyway自动创表的详细配置
You might like
Godaddy空间Zend Optimizer升级方法
2010/05/10 PHP
php利用反射实现插件机制的方法
2015/03/14 PHP
PHP中include/require/include_once/require_once使用心得
2016/08/28 PHP
PHP递归获取目录内所有文件的实现方法
2016/11/01 PHP
PHP基础之输出缓冲区基本概念、原理分析
2019/06/19 PHP
XENON基于JSON变种
2010/07/27 Javascript
javascript模拟的Ping效果代码 (Web Ping)
2011/03/13 Javascript
浅谈Javascript面向对象编程
2011/11/15 Javascript
JS写的贪吃蛇游戏(个人练习)
2013/07/08 Javascript
JS限制文本框只能输入数字和字母方法
2015/02/28 Javascript
JavaScript取得WEB安全颜色列表的方法
2015/07/14 Javascript
深入探讨前端框架react
2015/12/09 Javascript
浅谈String.valueOf()方法的使用
2016/06/06 Javascript
jQuery EasyUI封装简化操作
2016/09/18 Javascript
微信小程序 五星评价功能的实现
2017/03/09 Javascript
深入理解JavaScript 参数按值传递
2017/05/24 Javascript
JS学习笔记之数组去重实现方法小结
2019/05/29 Javascript
JS实现密码框效果
2020/09/10 Javascript
[00:32]2018DOTA2亚洲邀请赛Mineski出场
2018/04/04 DOTA
[55:18]Liquid vs Chaos 2019国际邀请赛小组赛 BO2 第一场 8.15
2019/08/16 DOTA
举例讲解Python中装饰器的用法
2015/04/27 Python
python基于BeautifulSoup实现抓取网页指定内容的方法
2015/07/09 Python
Python 利用切片从列表中取出一部分使用的方法
2019/02/01 Python
Tensorflow分类器项目自定义数据读入的实现
2019/02/05 Python
python进阶之自定义可迭代的类
2019/08/20 Python
python协程gevent案例 爬取斗鱼图片过程解析
2019/08/27 Python
150行python代码实现贪吃蛇游戏
2020/04/24 Python
Python3爬虫中Selenium的用法详解
2020/07/10 Python
python 制作磁力搜索工具
2021/03/04 Python
Myprotein葡萄牙官方网站:英国优质运动营养品牌
2016/09/12 全球购物
荷兰在线体育用品商店:Avantisport.nl
2018/07/04 全球购物
体育教学随笔感言
2014/02/24 职场文书
五一劳动节活动总结
2015/02/09 职场文书
2019最新企业员工考勤管理制度(通用版)!
2019/07/02 职场文书
 Python 中 logging 模块使用详情
2022/03/03 Python
MySQL深分页问题解决思路
2022/12/24 MySQL