基于情感向量工作流。
当前存在的问题:
1,目前的情感表现过于浮夸,太多用力重读,表现过度。
2,无法控制读音的力度,即使【低落】设置超0.8,还是很多大力重读,和低落的情绪完全相悖。例如描述要求奄奄一息无力轻声,结果还是很有力气很有精神的大力重读。
3,声音克隆还原度较差,特别是语速放慢到0.8及以下的情况,还原度大概只有70%,还可能混入奇怪的语音。
4,没有音调控制,例如升8度或降4度。
5,情感类型少,很多情况无法表现。
针对以上问题,建议能做出以下加强:
1,从整体上抑制滥用重读;
2,增加发音力度控制,0=奄奄一息/有气无力/濒死,0.5=通常,1.0=激动亢奋上头情绪失控;
3,优化慢速下对声音的还原度;
4,加入音调控制,0=偏低沉/低音,0.5=通常,1.0=高亢/高音;
5,增加态度/风格分类控制。用于情感向量:
例如:重视度:0=轻视/蔑视,0.5=通常,1.0=郑重/重视;其他如谨慎、轻佻、讥讽、诱惑、豪放、冷峻、温柔、撒娇等;
谢谢。
基于情感向量工作流。
当前存在的问题:
1,目前的情感表现过于浮夸,太多用力重读,表现过度。
2,无法控制读音的力度,即使【低落】设置超0.8,还是很多大力重读,和低落的情绪完全相悖。例如描述要求奄奄一息无力轻声,结果还是很有力气很有精神的大力重读。
3,声音克隆还原度较差,特别是语速放慢到0.8及以下的情况,还原度大概只有70%,还可能混入奇怪的语音。
4,没有音调控制,例如升8度或降4度。
5,情感类型少,很多情况无法表现。
针对以上问题,建议能做出以下加强:
1,从整体上抑制滥用重读;
2,增加发音力度控制,0=奄奄一息/有气无力/濒死,0.5=通常,1.0=激动亢奋上头情绪失控;
3,优化慢速下对声音的还原度;
4,加入音调控制,0=偏低沉/低音,0.5=通常,1.0=高亢/高音;
5,增加态度/风格分类控制。用于情感向量:
例如:重视度:0=轻视/蔑视,0.5=通常,1.0=郑重/重视;其他如谨慎、轻佻、讥讽、诱惑、豪放、冷峻、温柔、撒娇等;
谢谢。