تشخیص اشیا در خودروهای خودران

خودروهای خودران برای حرکت در خیابان باید بتوانند محیط اطراف خود را مانند یک سیستم ادراکی هوشمند مشاهده، تحلیل و تفسیر کنند. تشخیص خودروهای دیگر، عابران پیاده، دوچرخهسواران، تابلوهای راهنمایی، چراغهای راهنمایی، خطوط جاده و موانع مختلف، بخشی از فرایندی است که به آن «ادراک محیط» یا Perception گفته میشود.
در این میان، پردازش تصویر و بینایی ماشین نقش مهمی دارند. دوربینهای نصبشده روی خودرو حجم زیادی از اطلاعات تصویری را دریافت میکنند و الگوریتمهای هوش مصنوعی تلاش میکنند از این تصاویر، اطلاعات قابل استفاده برای سیستم رانندگی استخراج کنند.
با این حال، یک خودروی خودران فقط با «دیدن» یک شیء نمیتواند رانندگی کند. سیستم باید بتواند تشخیص دهد آن شیء چیست، کجا قرار دارد، با چه سرعتی حرکت میکند و احتمالاً در لحظات بعدی چه رفتاری خواهد داشت. به همین دلیل، پردازش تصویر در خودروهای خودران بخشی از یک زنجیره بزرگتر از ادراک، تشخیص، رهگیری، پیشبینی و تصمیمگیری است.

پردازش تصویر در خودروهای خودران به مجموعهای از روشها گفته میشود که دادههای تصویری دریافتشده از دوربینها را به اطلاعات قابل فهم برای سیستم هوشمند تبدیل میکنند.
یک تصویر خام برای سیستم رانندگی بهتنهایی معنای زیادی ندارد. الگوریتم باید بتواند بخشهای مختلف تصویر را تحلیل کند و مشخص کند کدام قسمت مربوط به جاده، کدام قسمت مربوط به خودرو، کدام قسمت مربوط به عابر و کدام قسمت مربوط به یک مانع است.
در سیستمهای مدرن، شبکههای عصبی عمیق و مدلهای بینایی ماشین میتوانند برای تشخیص اشیا، دستهبندی، بخشبندی تصویر و تحلیل محیط مورد استفاده قرار بگیرند. در برخی معماریها نیز اطلاعات دوربین با دادههای LiDAR و رادار ترکیب میشود تا درک دقیقتری از محیط سهبعدی اطراف خودرو شکل بگیرد.
برای پیشگامان لوتوس، این حوزه نمونهای از کاربردهای پیشرفته هوش مصنوعی است که در آن نرمافزار، داده، مدلهای یادگیری ماشین و پردازش بلادرنگ باید در کنار یکدیگر کار کنند.

تشخیص اشیا یا Object Detection یکی از مهمترین وظایف بینایی ماشین در خودروهای خودران است. هدف این فناوری فقط شناسایی یک تصویر نیست؛ بلکه باید مشخص شود چه اشیایی در تصویر وجود دارند و موقعیت آنها در کادر کجاست.
برای مثال، سیستم ممکن است یک خودرو را در مقابل خود، یک عابر در سمت راست جاده و یک دوچرخهسوار در سمت چپ تشخیص دهد. سپس موقعیت این اشیا در فریمهای متوالی بررسی میشود تا سیستم بتواند حرکت آنها را نیز دنبال کند.
در پروژههای پیشرفتهتر، تشخیص دوبعدی به تشخیص سهبعدی تبدیل میشود. در این حالت، سیستم تلاش میکند موقعیت و ابعاد اشیا را در فضای سهبعدی تخمین بزند. دیتاستهای تحقیقاتی خودروهای خودران نیز از Bounding Boxهای دوبعدی و سهبعدی، Tracking ID و دادههای چندحسگری برای توسعه و ارزیابی مدلهای ادراک استفاده میکنند.

دوربین تنها حسگر مورد استفاده در بسیاری از سیستمهای خودران نیست. هر حسگر نوع متفاوتی از اطلاعات را در اختیار سیستم قرار میدهد.
دوربین میتواند اطلاعات بصری و معنایی زیادی مانند رنگ چراغ راهنمایی، تابلوها، خطوط جاده و ظاهر اشیا را ثبت کند. LiDAR با اندازهگیری فاصله و ایجاد دادههای سهبعدی، اطلاعات هندسی دقیقی از محیط ارائه میدهد. رادار نیز میتواند اطلاعاتی درباره فاصله و سرعت اشیا ارائه کند و در شرایطی مانند باران، مه یا برف نقش مهمی داشته باشد.
ترکیب این دادهها را میتوان Sensor Fusion نامید. در این رویکرد، سیستم به جای تکیه بر یک منبع اطلاعاتی، دادههای چند حسگر را با یکدیگر ترکیب میکند تا تصویر کاملتری از محیط ایجاد شود.
این موضوع یکی از بخشهای پیچیده توسعه سیستمهای خودران است، زیرا دادههای حسگرهای مختلف باید از نظر زمان، موقعیت و مختصات با یکدیگر هماهنگ شوند.

تشخیص خودرو یا عابر تنها بخشی از مسئله است. خودرو باید بداند در چه محیطی قرار دارد و مسیر قابل حرکت کجاست.
Lane Detection برای شناسایی خطوط مسیر و محدوده حرکت خودرو استفاده میشود. اما سیستمهای پیشرفتهتر به دنبال درک کاملتر صحنه هستند؛ برای مثال باید بتوانند جاده، پیادهرو، تقاطع، چراغ راهنمایی، تابلو، خودروهای پارکشده، موانع و سایر اجزای محیط را از یکدیگر تفکیک کنند.
این قابلیت با مفهومی مانند Semantic Segmentation ارتباط دارد؛ یعنی تصویر به بخشهای معنایی مختلف تقسیم میشود تا سیستم بتواند درک دقیقتری از ساختار محیط داشته باشد. در دیتاستهای پژوهشی خودروهای خودران، کلاسهایی مانند خودرو، عابر، دوچرخه، جاده، پیادهرو، خطوط مسیر و چراغ راهنمایی برای آموزش مدلهای درک صحنه مورد استفاده قرار میگیرند.

تشخیص یک شیء در یک فریم کافی نیست. خودرو باید بتواند آن شیء را در فریمهای بعدی نیز دنبال کند.
برای مثال، اگر یک عابر در کنار خیابان حرکت کند، سیستم باید بتواند موقعیت او را در طول زمان دنبال کند. اگر خودروی جلویی سرعت خود را کاهش دهد، سیستم باید این تغییر را تشخیص دهد و اطلاعات آن را در اختیار بخشهای بعدی سامانه قرار دهد.
اینجاست که Object Tracking اهمیت پیدا میکند. سیستم با استفاده از اطلاعات چند فریم متوالی میتواند مسیر حرکت اشیا را بررسی کند. در مرحله بعد، مدلهای پیشبینی میتوانند بر اساس دادههای گذشته، سناریوهای احتمالی حرکت را تخمین بزنند.
در پژوهشهای مربوط به رانندگی خودکار، دادههای مربوط به مسیر حرکت خودروها، عابران و دوچرخهسواران برای توسعه مدلهای پیشبینی رفتار و حرکت استفاده میشوند.

محیط واقعی بسیار پیچیدهتر از دادههای آزمایشگاهی است. نور شدید خورشید، تاریکی، باران، برف، مه، انعکاس نور، سایه، آلودگی لنز و حتی اشیای غیرمعمول میتوانند عملکرد سیستم بینایی ماشین را تحت تأثیر قرار دهند.
یک چالش مهم دیگر، وجود موقعیتهای نادر یا اصطلاحاً Long Tail است. ممکن است سیستم در هزاران سناریوی معمول عملکرد مناسبی داشته باشد، اما یک موقعیت بسیار نادر مانند ظاهر شدن ناگهانی یک مانع، ترکیب غیرمعمول چند شیء یا شرایط نوری پیچیده نیازمند مدل و داده مناسب باشد.
به همین دلیل، توسعه سیستمهای ادراک خودروهای خودران فقط به آموزش یک مدل محدود نمیشود. جمعآوری داده متنوع، برچسبگذاری، شبیهسازی، آزمایش، ارزیابی و بهبود مداوم مدلها اهمیت زیادی دارد. پژوهشهای صنعتی نیز بر تنوع داده، سناریوهای مختلف و ترکیب چند حسگر برای افزایش توانایی ادراک تأکید دارند.

یکی از مهمترین تفاوتهای پردازش تصویر در خودروهای خودران با بسیاری از کاربردهای معمول بینایی ماشین، نیاز به پردازش بلادرنگ است.
سیستم باید دادههای حسگرها را در مدت زمان بسیار کوتاهی دریافت و پردازش کند. بنابراین علاوه بر دقت مدل، سرعت استنتاج، مصرف انرژی، معماری سختافزاری و نحوه اجرای مدل روی سیستم خودرو نیز اهمیت پیدا میکند.
در معماریهای جدید، پردازندهها و شتابدهندههای محاسباتی داخل خودرو برای اجرای مدلهای هوش مصنوعی و پردازش دادههای حسگر به کار گرفته میشوند. برای نمونه، Waymo در توضیحات فنی سال ۲۰۲۶ خود، پردازش بلادرنگ و طراحی سختافزار و نرمافزار متناسب با محدودیتهای محاسباتی خودرو را از اجزای مهم سامانه خود معرفی کرده است.
این موضوع نشان میدهد که در پروژههای AI پیشرفته، فقط انتخاب یک مدل قدرتمند کافی نیست؛ بلکه کل زنجیره داده تا پردازش و استقرار باید برای محیط عملیاتی طراحی شود.

مسیر آینده این فناوری به سمت مدلهای چندوجهی، درک عمیقتر صحنه، تشخیص سهبعدی، Sensor Fusion و مدلهای End-to-End حرکت میکند. پژوهشهای جدید نیز به سمت مدلهایی رفتهاند که بتوانند اطلاعات تصویری و سایر ورودیها را برای انجام وظایفی مانند تشخیص سهبعدی، درک محیط و برنامهریزی مسیر ترکیب کنند.
در آینده، سیستمهای خودران احتمالاً فقط به تشخیص اشیای منفرد محدود نخواهند بود؛ بلکه تلاش میکنند ارتباط میان اشیا، ساختار محیط و رفتار احتمالی عوامل مختلف را بهتر درک کنند.
برای شرکتهایی مانند پیشگامان لوتوس، توسعه چنین فناوریهایی نشاندهنده مسیر گستردهای است که هوش مصنوعی، بینایی ماشین، پردازش داده و نرمافزارهای هوشمند میتوانند در آن با یکدیگر ترکیب شوند.
پردازش تصویر و تشخیص اشیا یکی از پایههای اصلی فناوری خودروهای خودران است. خودرو برای حرکت مستقل باید بتواند محیط اطراف خود را مشاهده کند، اشیا را تشخیص دهد، موقعیت آنها را تخمین بزند، حرکتشان را دنبال کند و دادههای بهدستآمده را در اختیار سیستمهای پیشبینی و تصمیمگیری قرار دهد.
دوربین، LiDAR و رادار هرکدام اطلاعات متفاوتی ارائه میکنند و ترکیب این دادهها میتواند درک جامعتری از محیط ایجاد کند. در کنار سختافزار، مدلهای یادگیری عمیق، پردازش بلادرنگ، دادههای آموزشی و ارزیابی مداوم نیز بخش مهمی از این اکوسیستم هستند.
پردازش تصویر در خودروهای خودران نمونهای روشن از جایی است که هوش مصنوعی از یک قابلیت نرمافزاری ساده فراتر میرود و به بخشی از یک سیستم پیچیده و فیزیکی تبدیل میشود. توسعه چنین راهکارهایی به ترکیبی از مهندسی نرمافزار، هوش مصنوعی، پردازش داده و زیرساخت محاسباتی نیاز دارد؛ حوزههایی که پیشگامان لوتوس میتواند در آنها تجربه و توانمندیهای فنی خود را به کار بگیرد.
مقالههای ما:"Text-to-Video؛ انقلاب هوش مصنوعی در ساخت ویدیو"
قصد انجام پروژه خاصی را دارید؟
اگر میخواهید وبسایتی منحصربهفرد، متناسب با نیازهای خاص خودتان داشته باشید، یا اگر گمان میکنید داشتن یک اپلیکیشن موبایلی اهداف کسبوکارتان را محقق میکند، یا اگر هنوز نمیدانید چه محصولی برای پیادهسازی ایدهتان به کار میآید، با ما تماس بگیرید. شرکت نرمافزاری پیشگامان لوتوس با مشاوره و طراحی محصول ایدهآل، شما را در مسیر رشد کسبوکارتان همراهی میکند.