伍元胜
(中国西南电子技术研究所,成都 610036)
无线自组网(例如车联网、无人机网络等)随着网络节点的移动,网络拓扑持续动态变化。传统的动态路由技术通常基于固定的路由策略,难以适应网络的动态变化。例如,目的节点序列距离矢量(Destination Sequenced Distance Vector,DSDV)路由协议[1]以路由跳数为链路权值,计算最短路径,无法适应拓扑变化引起的瓶颈链路变化,从而导致网络拥塞。近年来,深度强化学习在决策与智能化控制问题上取得了巨大的进步。深度强化学习可以适应环境的变化,已被用于求解网络的路由问题[2-12]。现有的深度强化学习路由大多使用传统的神经网络(如多层感知机[4-11]、卷积神经网络[3,12]、长短期记忆神经网络[5]),并不适合学习图结构信息[2],无法提取网络拓扑图的特征,这导致算法需要针对不同的网络拓扑进行修改和重新训练,无法适应拓扑的动态变化。
在图像识别、自然语言处理领域,深度学习取得了巨大的成功,这得益于深度学习具有自动提取特征的能力。现代的深度学习方法通常遵循“端到端”的设计哲学,强调最小化先验表示与计算假设,并避免显式的结构与手工特征[13]。然而,在网络路由领域,传统的端到端深度学习难以提取网络拓扑特征。文献[8]研究表明,深度学习结合传统的特征工程具有更好的路由性能。另一种思路是使用图神经网络自动提取网络拓扑的特征,实现对不同网络拓扑的泛化[2]。
文献[2]基于K条候选路径路由,使用消息……