API v1.1.0 已发布:掼蛋深度优化 · SLOTS 正式开放 · WebSocket 断线续传
真人AI

非完美信息博弈AI是如何做决策的?

真人AI 技术团队··约 12 分钟阅读

棋牌属于非完美信息博弈:看不到对手手牌、信息随牌局展开。本文拆解从CFR反事实遗憾最小化到深度强化学习的决策技术路线,以及生产环境中的工程化取舍。

结论:非完美信息博弈的核心是“在不确定下决策”

围棋、国际象棋是完美信息博弈:双方看到同一棋盘,搜索(MCTS)就能逼近最优。而扑克、麻将、斗地主、掼蛋的核心困难是信息不对称——你看不到对手的手牌,最优策略依赖于对对手私有信息的概率推断。

这带来一个本质区别:完美信息博弈的最优解是确定性的,而非完美信息博弈的最优解往往是一种混合策略(bluffing 存在的原因)。直接把国际象棋那套搜索搬过来,在牌桌上是不成立的。

技术路线一:CFR家族

反事实遗憾最小化(Counterfactual Regret Minimization)是求解非完美信息博弈近似纳什均衡的经典框架:通过迭代计算每个信息集上的“遗憾值”,逐步收敛到均衡策略。扑克AI Libratus、Pluribus 的成功证明了这条路线的上限。

局限在于状态空间:麻将的牌型组合空间巨大,直接对完整博弈树跑 CFR 不可行,需要配合抽象(card abstraction)把相似状态聚类,而抽象粒度直接决定了强度的天花板。

技术路线二:深度强化学习

以 DouZero 为代表的自博弈深度强化学习路线,用神经网络近似策略价值函数,通过海量自我对弈迭代提升。优点是不依赖人工抽象、对大数据量玩法(斗地主)效果好;缺点是训练成本高、对局风格趋同(收敛到单一强策略),拟人化需要额外的策略池与风格化处理。

我们的生产方案是两者混合:CFR类方法构建基线策略保证下限,深度强化学习提升强度上限,再叠加行为模型层(节奏、失误、性格)做拟人化输出。

生产环境的三个工程现实

论文到生产之间隔着三个工程鸿沟,这也是开源方案难以直接商用的原因。

  • 延迟预算:牌桌上出牌延迟超过 2 秒玩家就会察觉异常,我们的决策 P95 延迟控制在 50ms 内,需要模型量化、缓存与推理优化
  • 规则正确性:商业玩法的地方规则变体(血战到底、敲麻计番)必须100%正确,开源实现几乎都需要大规模补课
  • 可控性:运营需要胜率控制、情绪响应等干预接口,纯自博弈模型需要额外的策略调整层才能支持

模型之外:信息聚合是拟人化的隐藏门槛

真人玩家的决策不只依赖手牌,还依赖牌河记忆、对手行为模式、局外上下文(积分、连败)。让AI“像人”,需要把这些信息结构化后喂给决策层——记牌器式的显式记忆模块 + 对手建模(opponent modeling)比加深网络更有效。

我们的机器人具备对手画像能力:对激进玩家收紧抓牌、对谨慎玩家施加压力。这类动态适应,是静态策略模型无法提供的,也是 API 化之后中小团队最难自建的部分。

上线第一天,就让玩家匹配到“真人”

30 天全功能免费试用,5 分钟接入首个AI牌局。开通试用请添加商务微信 kxlin0101 或发送邮件至 skyin.lewis@gmail.com。