研究热点
LLM + 无人机 + 机器人领域 · 每日更新
🔥 研究趋势
💡 综合 arXiv 论文 + 行业资讯 + GitHub 项目,判断当前研究风向
🤖 LLM + VLA 双层架构
LLM做意图理解,VLA做动作执行,分工明确。DIAL架构成为主流范式。
📡 NL → STL → 控制
自然语言先转为时序逻辑(STL),再生成安全轨迹。CoT+GRPO确保翻译正确性。
🖥️ 边缘部署优先
实时VLA、TensorRT-LLM等都在优化边缘推理速度,适合机载计算。
🎯 仿真平台统一
CARLA-Air统一AirSim和CARLA,减少仿真-真机迁移gap。
📰 最新资讯 (4)
💡 来自 TechCrunch / NVIDIA / Unitree / DJI 等的行业动态、产品发布、公司新闻
银河通用发布人形机器人全身控制大模型 AstraBrain-WBC 0.5(人形小脑GPT时刻)
> 📄 完整 PDF:`reports/daily_briefing/briefing_2026-06-22.pdf` 珠海:多云 +30°C 70% ↗18km/h - 银河通用发布人形机器人全身控制大模型 AstraBrain-WBC 0.5(人形小脑GPT时刻) — 网易/机器之心
阅读原文 →
对你的价值
> 📄 完整 PDF 版本:`reports/daily_briefing/briefing_2026-06-20.pdf` 珠海:Light Rain Shower +29°C 84% ↑23km/h - [阿里发布 Qwen-Robot 全栈具身智能套件](https://www.alibabacloud.com/blog/entering-the-physical-ai-era-introd
阅读原文 →
AI 大模型加速融合 Agent 能力
> 📄 完整 PDF 版本: `reports/daily_briefing/briefing_2026-06-19.pdf` 珠海 · 中雨转小雨/多云 · 25-30°C · 风 3-4级 · 出门带伞 ☔ - AI 大模型加速融合 Agent 能力: DeepSeek V4 (双版本 1M 上下文)、谷歌 Gemini 3.0 (Spark 24h Agent)、OpenAI GPT
阅读原文 →
Figure AI 获 10 亿美元 C 轮融资
> 📄 完整 PDF 版本:`reports/daily_briefing/briefing_2026-06-17.pdf` Light Rain Shower, Rain Shower +28°C 84% ↑26km/h - Figure AI 获 10 亿美元 C 轮融资,估值达 26 亿美元,人形机器人进入量产冲刺期
阅读原文 →
📚 最新论文 (20)
💡 来自 arXiv / OpenAlex / ICRA 等的最新学术论文,按相关性排序
DIAL: Decomposing Vision-Language Models into Intent Understanding and Action Decoding
problem: VLM不应只做编码器,需解耦高层意图理解和动作解码。method: Intent Bottleneck编码意图+Action Decoding解码动作,实现LLM→VLA→PX4解耦。value: 首次实现VLA架构的意图-动作分离。why_relevant: 直接支撑LLM→VLA→PX4毕设架构设计。
arXiv 原文 →
LLM-Enabled UAV NL Navigation: Natural Language to Signal Temporal Logic for Autonomous Flight
problem: 自然语言指令难以保证无人机安全执行。method: NL→STL→MILP轨迹优化,CoT推理+GRPO确保翻译正确性,STL修复机制处理不可行约束。value: 首个可证安全的LLM无人机控制框架。why_relevant: STL修复机制可直接应用于PX4安全护栏设计。
arXiv 原文 →
FALCON: 3D Spatial Token Injection for Vision-Language-Action Models
problem: 现有VLA缺乏3D空间先验,无法处理无人机避障需求。method: 3D空间Token注入VLA动作头,保持视觉-语言对齐。value: 无需深度相机即可实现3D理解。why_relevant: 3D空间先验对UAV避障和导航至关重要,直接匹配毕设需求。
arXiv 原文 →
RehearseVLA: World Model Post-Training for Vision-Language-Action Models
problem: VLA数据稀缺且训练不安全。method: 世界模型作为虚拟环境,解决数据稀缺问题,物理一致性确保模拟到真实迁移。value: 首个世界模型驱动的VLA后训练框架。why_relevant: UAV数据稀缺+安全训练的理想方案,RehearseVLA范式可迁移到无人机仿真。
arXiv 原文 →
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
problem: 无人机视觉语言导航在城市环境中面临细粒度地标匹配和多模态信息编码挑战。method: 提出NavAgent模型,使用GLIP地标识别器和拓扑图编码器融合多尺度环境信息。value: 首个城市环境UAV VLN模型,在Touchdown和Map2seq数据集上实现SOTA。why_relevant: 直接对口长时程无人机VLN导航的地标匹配和上下文动态聚焦需求。
arXiv 原文 →
UAV-Track VLA: Vision-Language-Action Models for Embodied Aerial Object Tracking
problem: 空中跟踪任务缺乏端到端VLA方案。method: 首个将VLA模型应用于无人机空中跟踪,实现感知-跟踪-控制一体化。value: 填补了VLA空中跟踪领域的空白。why_relevant: VLA从桌面操作向空中扩展的标杆工作,对理解VLA在UAV场景的适用性具有重要参考价值。
arXiv 原文 →
CARLA-Air: Unified Aerial-Ground Simulation Infrastructure
problem: 空中仿真工具碎片化,难以统一测试。method: AirSim + CARLA统一到单一Unreal Engine进程,零修改复用AirSim API+ROS 2,支持18种传感器模态。value: 首个空地一体仿真平台。why_relevant: 毕设仿真验证的理想环境,可直接用于PX4+LLM控制算法的仿真测试。
arXiv 原文 →
LeRobot: An Open-Source Library for End-to-End Robot Learning
problem: 机器人学习工具链碎片化,难以复现和迁移。method: HuggingFace开源机器人学习库,支持多种机器人(SO-100/SO-ARM100/101)、多种VLA模型(π0、SmolVLA等)、端到端训练推理。value: 首个支持开源机器人全流程的库。why_relevant: Garfield项目核心框架,SO-ARM101双臂机器人直接支持,VLA模型可直接用于毕设机械臂控制。
arXiv 原文 →
Libra-VLA: Dual-System Vision-Language-Action Model with Asynchronous Processing
problem: 单一VLA系统难以兼顾语义理解和快速动作执行。method: 异步粗-细双系统,System1处理语义、System2处理动作,学习均衡机制。value: 首个异步双系统VLA架构。why_relevant: 直接对应UAV巡航的层次化需求,Libra-VLA的双系统架构可迁移到无人机分层控制。
arXiv 原文 →
LaST-R1: Latent Space Reasoning for Vision-Language-Action Models
problem: 语言链推理(CoT)导致VLA推理瓶颈。method: 潜在空间推理替代语言链,物理接地的自适应推理深度。value: 消除VLA推理瓶颈,推理效率提升3-5倍。why_relevant: 高效推理适合UAV实时控制,LaST-R1的潜在推理范式可直接应用于边缘部署的实时VLA。
arXiv 原文 →
MotuBrain: Unified World-Action Model for Robot Control
problem: 感知-预测-控制分离导致协同困难。method: 统一世界模型+动作模型,视频预测驱动的动作生成。value: 首个感知-预测-控制一体化框架。why_relevant: 感知-预测-控制一体化框架可直接参考,MotuBrain的世界模型可用于无人机仿真环境构建。
arXiv 原文 →
Flying by Inference: Proactive Inference World Model for Multi-UAV Planning
problem: 多UAV轨迹规划计算复杂度高。method: 主动推理世界模型,多UAV轨迹规划从组合优化→层次化推理。value: 将多机编队复杂度从指数级降至线性。why_relevant: 多机编队扩展的参考架构,Flying by Inference的世界模型驱动的推理方法可用于PX4集群控制。
arXiv 原文 →
SafeNav: Safe Path Navigation using Landmark Based Localization in a GPS-denied Environment
problem: GPS拒止环境下无人机导航定位困难。method: 基于地标的定位方法(LanBLoc)结合战场特定运动模型(BMM)和扩展卡尔曼滤波(EKF)。value: 首个在战场GPS拒止环境中实现安全路径导航的方案。why_relevant: GPS拒止场景的替代导航方案,地标定位可应用于室内/密闭环境无人机控制。
arXiv 原文 →
Say the Mission, Execute the Swarm: Agent-Enhanced LLM Reasoning for Drone Swarms
problem: 无人机蜂群任务执行缺乏从自然语言到执行的完整管线。method: Agent增强的LLM蜂群推理架构,Web-of-Drones架构。value: 首个端到端的LLM Agent驱动的无人机蜂群框架。why_relevant: LLM+Agent+UAV Swarm三个方向交叉点,与毕设LLM+无人机核心方向高度吻合。
arXiv 原文 →
DriveAgent: Multi-Agent Structured Reasoning with LLM and Multimodal Sensor Fusion for Autonomous Driving
problem: 单一LLM难以保证自动驾驶的安全性和可解释性。method: 四Agent架构,描述分析Agent、LiDARAgent、视觉Agent、环境推理Agent协作进行多模态传感器融合决策。value: 首个多Agent LLM驱动的自动驾驶框架,实现可解释的安全决策。why_relevant: PX4安全护栏的参考架构,多Agent设计可直接应用于无人机的LLM+安全护栏实现。
arXiv 原文 →
RAFT-Stereo: Recurrent All-Pairs Field Transforms for Stereo Matching
problem: 传统双目匹配方法精度和效率难以兼顾。method: RAFT用于双目匹配,通过迭代优化获取精确视差。value: 首个端到端双目匹配网络,KITTI刷新SOTA。why_relevant: 双目深度估计基础网络,RAFT-Stereo是稠密建图和视觉里程计的核心模块。
arXiv 原文 →
ORB-SLAM3: An Open-Source SLAM System for Monocular, Stereo, and RGB-D Cameras
problem: 现有SLAM系统难以兼顾精度、实时性和多传感器支持。method: 统一视觉惯性SLAM架构,支持单目/双目/RGB-D多种传感器,IMU融合。value: 首个支持多传感器和地图重用的开源SLAM系统。why_relevant: 稠密建图的基础框架,ORB-SLAM3是双目SLAM的标杆可直接用于毕设感知模块。
arXiv 原文 →
Realtime-VLA V2: Learning to Run VLAs Fast, Smooth and Accurate
problem: VLA模型推理延迟高,难以满足无人机实时性需求。method: EAGLE-3投机解码+NVFP4量化优化,边缘设备(Jetson)上快速流畅运行VLAs。value: 首个边缘优化的实时VLA框架。why_relevant: 适合无人机实时性需求,Realtime-VLA的量化方案可直接应用于Jetson边缘部署。
arXiv 原文 →
FocusVLA: Visual Attention Optimization for Efficient Vision-Language-Action Models
problem: VLA视觉利用效率低,快捷路径导致动作预测偏差。method: Modality Cascaded Attention消除快捷路径,边缘部署计算优化。value: 视觉利用率提升40%,推理速度提升2倍。why_relevant: 边缘VLA优化方法可直接应用于无人机边缘部署的性能提升。
arXiv 原文 →
Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2
problem: VLM模型与无人机边缘设备资源矛盾。method: BLIP-2轻量化方案,边缘优化的多模态学习。value: 首个面向UAV边缘设备的VLM方案。why_relevant: 毕设若涉及实际无人机部署,边缘优化是不可回避的技术挑战,BLIP-2方案可直接参考。
arXiv 原文 →
⭐ GitHub 热门项目 (16)
💡 与 LLM+无人机+机器人相关的开源工具、项目与框架
PX4 Autopilot
开源无人机自动驾驶软件,支持多旋翼、固定翼、VTOL等。学术界最流行的无人机研究平台。
Prometheus (amov-lab)
PX4无人机自主飞行综合解决方案,包含目标追踪、集群控制、SLAM等30+应用模块。累计3.1k+ stars。
embodied-drone-agents
LLM drone agent系统,使用MAVSDK-Python作为工具,LangGraph编排任务规划,支持自然语言控制无人机。
MAVLinkMCP
MCP (Model Context Protocol) server for LLM与MAVLink无人机的通信,支持通过MCP协议控制PX4无人机。
AerialVLA
端到端视觉-语言-动作无人机导航模型,支持自然语言指令控制无人机。
UAVs_Meet_LLMs
UAV+LLM综合资源库,汇总无人机与大语言模型结合的论文、项目、数据集。
Awesome-Aerial-VLN
空中视觉-语言导航(Aerial VLN)论文汇总:无人机VLN方向最新研究。
LeRobot
HuggingFace开源机器人学习库,支持多种机器人(SO-100/SO-ARM100/101)、多种VLA模型(π0、SmolVLA等)、端到端训练推理。Garfield项目核心框架。
dimensionalOS
Agentic OS for physical space,自然语言控制多种机器人(含无人机),支持多种AI模型和工具。
Awesome-LLM-Robotics
大语言模型/多模态模型在机器人领域的应用论文汇总。
awesome-embodied-vla-va-vln
Embodied AI/VLA/VLN综述列表,汇总具身智能、视觉-语言-动作模型、视觉语言导航相关论文。
Awesome-RL-VLA
RL+VLA论文汇总:强化学习视觉-语言-动作模型综述。
reflex-vla
一键部署VLA模型到边缘GPU,支持多种VLA模型的边缘优化推理。
CarlaAir
CARLA + 无人机空地一体仿真平台,统一AirSim + CARLA到单一Unreal Engine进程。
skynet
LLM + MCP协议控制真实机器人和无人机,支持自然语言控制多种平台。
Awesome-VLA-UAVs
VLA/VLN无人机论文/模型/数据集汇总,空中机器人VLA方向最全资源列表。
🔍 没有找到匹配的结果
尝试调整筛选条件或关键词