同一客户的多个 AJAX 请求共享 PHP Session。一个慢请求持有 Redis 锁时,其余请求会等待,看起来像 totals、运费或支付接口随机变慢。直接关闭锁可能造成购物车会话并发覆盖。
先固定复现条件
在浏览器瀑布图中找同一时间开始却依次结束的请求,关联 PHP-FPM slowlog、Nginx request_time 和 Redis 客户端。用测试会话复现,不记录真实 session ID。
grep -n "session" app/etc/env.php
redis-cli INFO clients
redis-cli INFO commandstats
ps -eo pid,etime,%cpu,%mem,cmd | grep '[p]hp-fpm'
grep -R "request_slowlog_timeout" /etc/php* 2>/dev/null
根据结果定位根因
外部支付调用、同步邮件、远程库存查询或自定义 Observer 在 session 打开期间执行,会长时间持锁。锁重试次数与等待时间不当只会放大症状。
修复时保留回滚路径
先缩短持锁请求,把外部工作移到队列并尽早关闭不再需要的 session。谨慎调整 max_concurrency、break_after_frontend 等参数,保留并发一致性与回滚配置。
上线后的验收
模拟结账页面的并发 totals、shipping 与 payment 请求,P95 延迟明显下降且购物车不丢商品。Redis 锁超时日志、PHP slowlog 和错误率连续观察一轮高峰。
生产环境操作前的检查
针对“Magento 2 Redis Session Lock 导致结账变慢”进行处理时,先记录 Magento 版本、部署模式、问题 Store View、复现时间和最近一次发布。所有 SQL 默认先执行 SELECT;需要 UPDATE、DELETE、补偿命令或目录删除时,必须先确认命中范围并保留可恢复备份。多 Web 节点环境还要比较代码版本、app/etc/env.php 摘要和当前流量节点,避免只修复其中一台。
php bin/magento --version
php bin/magento deploy:mode:show
php bin/magento maintenance:status
php bin/magento indexer:status
php bin/magento cache:status
命令应由 Magento 文件所有者在项目根目录执行。生产站不要同时运行多个全量索引或静态部署任务;若涉及数据库结构、库存、支付或订单,先在脱敏的生产数据副本验证,再安排维护窗口。
建立可比较的排查记录
每次实验只改变一个变量,并保存“操作前值、执行命令、开始时间、结束时间、结果、回滚方式”。至少准备一个正常对象和一个异常对象作对照,例如两个 SKU、两张订单或访客与登录客户。若修复后仅当前对象恢复,而新建对象仍会复现,说明根因尚未消除。
| 检查点 | 需要记录 | 通过标准 |
|---|---|---|
| 数据层 | 主键、Store/Website、更新时间、关联行数 | 关系完整且无孤儿记录 |
| 应用层 | 异常堆栈、模块、Cron/消费者状态 | 无新异常并可重复执行 |
| 缓存与索引 | 索引模式、版本、源站和公网响应 | 按预期周期自动更新 |
| 业务回归 | 正常路径、失败路径、重复请求 | 结果一致且没有重复副作用 |
修复后的观察窗口
上线后不要只刷新一次页面就结束。至少观察一轮 Cron、队列消费和索引周期,并在两台节点、无痕浏览器及目标 Store View 重复验证。对日志、数据库行数、错误率和响应时间设置临时观察项;确认它们稳定后再移除调试日志。调试日志可能包含客户、订单或令牌信息,采集时要脱敏,问题结束后及时关闭。

