请添加选项支持同时只有1个请求正在翻译中的功能
添加一个选项,使同时只有1个翻译请求正在翻译中:本地可以有多个翻译请求队列缓存,但真正在网络上发出给LLM模型进行翻译的只有1个请求,对外网络请求严格串行执行。当该翻译请求完整返回翻译结果后,系统才会自动触发下一个待处理请求的发送,即并发数严格为1,确保服务端的LLM模型侧始终只有一个正在执行的翻译请求。
该功能的落地背景为私有部署环境:这类环境对LLM服务的并发数有硬性约束,严格限制为1,一旦同时处理的请求数超过1,服务端将直接抛出错误。如果连续多次高频超并发、则会被加入黑名单进入静默期。
期望功能:
本地可以队列缓存多个翻译请求,但对外发送到网络上的请求永远不能超过1个,当且仅当上一个请求结果返回后,下一个请求才被发送到网络上。对外网络请求严格串行执行。
可选地,在相邻两个网络请求的结果返回与下一次请求发起之间,增加一段可由用户自定义时长(N毫秒)的间隔延时,进一步避免服务端误判请求并发,提升整体运行稳定性。即Request1 - Result1 - delay - Request2 - Result2 - ……。
