مقالات اقتصادی

مجموع مربعات باقیمانده (RSS) چیست؟

نمایش مفهومی خط رگرسیون و نقاط داده در یک محیط گرافیکی مدرن و مالی.

مجموع مربعات باقی مانده (Residual Sum of Squares – RSS) یک تکنیک آماری بنیادی است که برای اندازه گیری واریانس در مجموعه داده ها به کار می رود که توسط خود مدل رگرسیون توضیح داده نمی شود. به بیان دیگر، این معیار میزان واریانس موجود در جملات پسماند یا خطا (Error Term) را برآورد می کند.

در تحلیل های مالی و اقتصادسنجی، رگرسیون خطی (Linear Regression) ابزاری است که به تعیین شدت و ماهیت رابطه میان یک متغیر وابسته (مانند بازدهی یک سهام شاخص ساز یا یک جفت ارز اصلی در فارکس) و یک یا چند عامل دیگر تحت عنوان متغیرهای مستقل یا توضیحی (مانند نرخ بهره، تورم، شاخص دلار و…) کمک می کند. RSS ارزیابی می کند که چه مقدار از نوسانات متغیر وابسته فراتر از رابطه خطیِ تعریف شده باقی مانده است.

درک عمیق مفهوم مجموع مربعات باقی مانده (RSS)

به طور کلی، «مجموع مربعات» (Sum of Squares) یک روش ریاضی در تحلیل رگرسیون برای تعیین میزان پراکندگی نقاط داده حول یک خط یا منحنی است. در تحلیل رگرسیون، هدف نهایی این است که مشخص شود داده ها تا چه حد با یک تابع ریاضی تطابق دارند؛ تابعی که بتواند نحوه شکل گیری و رفتار سری زمانی داده ها را توضیح دهد.

مجموع مربعات به عنوان ابزاری ریاضی برای یافتن تابعی استفاده می شود که کمترین انحراف و خطا را از داده های واقعی داشته باشد.

شاخص RSS میزان خطای باقی مانده میان تابع رگرسیون و مجموعه داده ها را پس از اجرای مدل اندازه گیری می کند:

  • رقم کوچک تر برای RSS نشان دهنده تابعی است که به بهترین شکل ممکن بر داده ها منطبق شده است.

این شاخص که با نام مجموع مربعات پسماندها (Sum of Squared Residuals) نیز شناخته می شود، در اصل کارآمدی یک مدل رگرسیون را در بازنمایی و توضیح رفتار متغیرها به تصویر می کشد.

فرمول و نحوه محاسبه مجموع مربعات باقی مانده

فرمول ریاضی محاسبه RSS به صورت زیر است:

RSS=∑i=1n(yi−f(xi))2

متغیرهای فرمول

نماد توضیح
yᵢ مقدار واقعی مشاهده شده برای متغیر وابسته در داده i-اُم
f(xᵢ) مقدار پیش بینی شده برای yᵢ توسط مدل رگرسیون به ازای ورودی xᵢ
yᵢ − f(xᵢ) میزان پسماند یا خطای مشاهده i-اُم
n تعداد کل مشاهدات (حد بالای سیگما)

مراحل محاسبه گام به گام RSS

  1. به ازای هر داده، مقدار پیش بینی شده مدل را از مقدار واقعی کم کنید تا خطا (Residual) به دست آید.
  2. خطای هر داده را به توان دو برسانید (تا علامت های منفی از بین بروند و به خطاهای بزرگ تر وزن بیشتری داده شود).
  3. تمام مقادیر مجذور را با یکدیگر جمع بزنید.

مقایسه RSS و خطای استاندارد باقی مانده (RSE)

خطای استاندارد باقی مانده (Residual Standard Error یا RSE) یکی دیگر از شاخص های آماری برای ارزیابی تفاوت در انحراف معیار مقادیر واقعی در مقایسه با مقادیر پیش بینی شده است. RSE معیاری برای سنجش «نیکویی برازش» (Goodness-of-Fit) به شمار می رود و نشان می دهد نقاط داده تا چه حد با مدل هماهنگی دارند.

تفاوت عمده این است که RSE تعداد درجات آزادی مدل را نیز در نظر می گیرد:

RSE=RSSn−2=[RSSn−2]1/2

تفاوت کلیدی | RSE با تقسیم RSS بر تعداد مشاهدات منهای ۲ و سپس جذرگیری محاسبه می شود و درجات آزادی مدل را نیز در نظر می گیرد.

نمای نزدیک از یک نمودار آماری که فاصله بین نقاط و خط را نشان می‌دهد.

نمایش بصری مفهوم “پسماند” یا خطا در تحلیل‌های آماری.

کمینه سازی RSS برای دستیابی به برازش بهینه

در قلمرو تحلیل رگرسیون و مدل سازی مالی، به حداقل رساندن (Minimize کردن) مجموع مربعات باقی مانده امری حیاتی برای به دست آوردن دقیق ترین مدل پیش بینی است. یکی از بنیادی ترین و پرکاربردترین روش ها برای دستیابی به این هدف، رگرسیون حداقل مربعات (Least Squares Regression) یا همان روش OLS است.

رگرسیون حداقل مربعات به دنبال یافتن خط یا منحنی بهینه ای است که مجموع مربعات اختلاف میان مقادیر واقعی و پیش بینی شده را کمینه کند. هدف OLS ایجاد تعادلی است که در آن، مدل ضمن درک روند بنیادین (Underlying Trend) داده ها، فاصله میان واقعیت و پیش بینی را به کمترین سطح ممکن برساند.

فرآیند بهینه سازی RSS در یک رگرسیون خطی ساده شامل محاسبه دقیق شیب خط (Slope) و عرض از مبدأ (Intercept) است. در مدل های پیشرفته تر چندمتغیره و الگوریتم های یادگیری ماشین، این بهینه سازی از طریق الگوریتم های تکرارشونده و محاسبات ماتریسی انجام می گیرد.

محدودیت های شاخص RSS

با وجود کاربرد فراوان، RSS محدودیت های مهمی دارد که تحلیل گران بازارهای مالی باید به آن ها توجه کنند:

  1. حساسیت بالا به داده های پرت (Outliers): به دلیل مجذور شدن خطاها، نقاط داده پرت ناشی از شوک های ناگهانی بازار (مانند رخدادهای قوی سیاه یا اخبار اقتصادی غیرمنتظره) وزن نامتناسبی به خود می گیرند و می توانند ضرایب مدل را دچار تورش منفی کنند.
  2. وابستگی شدید به فرضیات آماری: اگر پیش فرض های اساسی رگرسیون مانند خطی بودن رابطه، استقلال خطاها از یکدیگر و ثبات واریانس خطاها (Homoscedasticity) نقض شوند، RSS می تواند نتایج گمراه کننده تولید کند.
  3. عدم کارایی در مقایسه مستقیم مدل ها با متغیرهای نامساوی: RSS تابعی از تعداد پارامترهای مدل است؛ افزودن متغیرهای جدید همواره RSS را کاهش می دهد حتی اگر متغیر جدید بی ربط باشد. بنابراین نمی توان صرفاً با RSS دو مدل با تعداد متغیرهای متفاوت را مقایسه کرد (در این شرایط از معیارهایی چون R² تعدیل شده، AIC یا BIC استفاده می شود).
  4. جعبه سیاه بودن ساختار روابط: RSS یک خروجی عددی کلی به دست می دهد و بینش عمیقی درباره کیفیت و مکانیسم اثرگذاری متغیرهای مستقل بر متغیر وابسته ارائه نمی کند.
نمادی از دقت و بهینه‌سازی در تحلیل داده‌های پیچیده.

نمایش مفهوم یافتن بهترین مسیر یا خط از میان داده‌های پراکنده.

ملاحظات ویژه در بازارهای مالی و سرمایه گذاری

بازارهای مالی جهانی روزبه روز بیشتر به سمت تحلیل های کمّی (Quantitative)، داده محور و الگوریتمی حرکت می کنند. صندوق های سرمایه گذاری و معامله گران برای کسب برتری تحلیلی (Alpha)، از تکنیک های پیشرفته آماری، کلان داده ها (Big Data)، هوش مصنوعی و یادگیری ماشین برای تدوین استراتژی های خود بهره می برند. در این چارچوب، معیارهای کلاسیک آماری همچون RSS نقشی کلیدی در غربالگری استراتژی ها ایفا می کنند.

از مدل های رگرسیونی می توان برای ارزیابی رابطه میان قیمت کامودیتی ها (مانند نفت خام برنت یا طلا) با سهام شرکت های تولیدکننده آن بخش، یا بررسی بتا و بتای اهرمی ارزهای دیجیتال نسبت به بیت کوین و شاخص نزدک استفاده کرد.

نکته کاربردی: محاسبه دستی RSS به دلیل مراحل پیاپی تفریق، به توان رساندن و جمع زدن در حجم بالای داده های بازار بسیار زمان بر و مستعد خطای محاسباتی است. در محیط های معاملاتی و تحلیلی، این محاسبات توسط نرم افزارهای تحلیلی نظیر Excel، زبان های برنامه نویسی Python (کتابخانه های NumPy و Statsmodels) یا R انجام می گیرد.

هر مدلی همواره مقداری خطا خواهد داشت. RSS همان بخشی از ریسک و نوسان را نشان می دهد که توسط تحلیل رگرسیون توضیح داده نشده است. البته باید مراقب پدیده بیش برازش (Overfitting) نیز بود؛ چرا که با پیچیده کردن بیش از حد مدل می توان RSS را به صفر نزدیک کرد، اما مدل حاصل روی داده های زنده و آینده بازار کارایی نخواهد داشت.

مثال کاربردی: محاسبه RSS در بررسی رابطه میان مخارج مصرف کننده و GDP

برای درک ملموس نحوه محاسبه RSS، همبستگی کلاسیک میان «مخارج مصرف کننده» (CS) و «تولید ناخالص داخلی» (GDP) را در میان ۲۷ کشور عضو اتحادیه اروپا بررسی می کنیم.

جدول ۱: مخارج مصرف کننده در برابر GDP کشورهای عضو اتحادیه اروپا

کشور مخارج مصرف کننده (میلیون دلار) تولید ناخالص داخلی – GDP (میلیون دلار)
اتریش ۳۰۹,۰۱۸.۸۸ ۴۳۳,۲۵۸.۴۷
بلژیک ۳۸۸,۴۳۶.۰۰ ۵۲۱,۸۶۱.۲۹
بلغارستان ۵۴,۶۴۷.۳۱ ۶۹,۸۸۹.۳۵
کرواسی ۴۷,۳۹۲.۸۶ ۵۷,۲۰۳.۷۸
قبرس ۲۰,۵۹۲.۷۴ ۲۴,۶۱۲.۶۵
جمهوری چک ۱۶۴,۹۳۳.۴۷ ۲۴۵,۳۴۹.۴۹
دانمارک ۲۵۱,۴۷۸.۴۷ ۳۵۶,۰۸۴.۸۷
استونی ۲۱,۷۷۶.۰۰ ۳۰,۶۵۰.۲۹
فنلاند ۲۰۳,۷۳۱.۲۴ ۲۶۹,۷۵۱.۳۱
فرانسه ۲,۰۵۷,۱۲۶.۰۳ ۲,۶۳۰,۳۱۷.۷۳
آلمان ۲,۸۱۲,۷۱۸.۴۵ ۳,۸۴۶,۴۱۳.۹۳
یونان ۱۷۴,۸۹۳.۲۱ ۱۸۸,۸۳۵.۲۰
مجارستان ۱۱۰,۳۲۳.۳۵ ۱۵۵,۸۰۸.۴۴
ایرلند ۱۶۰,۵۶۱.۰۷ ۴۲۵,۸۸۸.۹۵
ایتالیا ۱,۴۸۶,۹۱۰.۴۴ ۱,۸۸۸,۷۰۹.۴۴
لتونی ۲۵,۷۷۶.۷۴ ۳۳,۷۰۷.۳۲
لیتوانی ۴۳,۶۷۹.۲۰ ۵۶,۵۴۶.۹۶
لوکزامبورگ ۳۵,۹۵۳.۲۹ ۷۳,۳۵۳.۱۳
مالت ۹,۸۰۸.۷۶ ۱۴,۶۴۷.۳۸
هلند ۶۲۰,۰۵۰.۳۰ ۹۱۳,۸۶۵.۴۰
لهستان ۴۵۳,۱۸۶.۱۴ ۵۹۶,۶۲۴.۳۶
پرتغال ۱۹۰,۵۰۹.۹۸ ۲۲۸,۵۳۹.۲۵
رومانی ۱۹۸,۸۶۷.۷۷ ۲۴۸,۷۱۵.۵۵
جمهوری اسلواکی ۸۳,۸۴۵.۲۷ ۱۰۵,۱۷۲.۵۶
اسلوونی ۳۷,۹۲۹.۲۴ ۵۳,۵۸۹.۶۱
اسپانیا ۹۹۷,۴۵۲.۴۵ ۱,۲۸۱,۴۸۴.۶۴
سوئد ۳۸۲,۲۴۰.۹۲ ۵۴۱,۲۲۰.۰۶

از آنجا که مخارج مصرف کننده و GDP همبستگی مثبت بسیار بالایی دارند، می توان خط برازش بهینه رگرسیون را برای پیش بینی GDP بر مبنای مخارج مصرف کننده (CS) به دست آورد:

GDP=1.3232×CS+10447

اکنون با استفاده از این رابطه، GDP پیش بینی شده هر کشور محاسبه شده و با تفاضل آن از GDP واقعی و مجذور کردن حاصل، مجذور مربعات باقی مانده به دست می آید:

جدول ۲: مقایسه GDP پیش بینی شده و واقعی و محاسبه مجذور باقی مانده ها

کشور مخارج مصرف کننده (میلیون دلار) GDP واقعی (میلیون دلار) GDP پیش بینی شده (خط روند) مجذور باقی مانده
اتریش ۳۰۹,۰۱۸.۸۸ ۴۳۳,۲۵۸.۴۷ ۴۱۹,۳۴۰.۷۸ ۱۹۳,۷۰۲,۰۳۸.۸۲
بلژیک ۳۸۸,۴۳۶.۰۰ ۵۲۱,۸۶۱.۲۹ ۵۲۴,۴۲۵.۵۲ ۶,۵۷۵,۲۵۰.۸۸
بلغارستان ۵۴,۶۴۷.۳۱ ۶۹,۸۸۹.۳۵ ۸۲,۷۵۶.۳۲ ۱۶۵,۵۵۸,۹۳۲.۲۲
کرواسی ۴۷,۳۹۲.۸۶ ۵۷,۲۰۳.۷۸ ۷۳,۱۵۷.۲۳ ۲۵۴,۵۱۲,۶۴۱.۹۵
قبرس ۲۰,۵۹۲.۷۴ ۲۴,۶۱۲.۶۵ ۳۷,۶۹۵.۳۱ ۱۷۱,۱۵۶,۰۸۶.۰۳
جمهوری چک ۱۶۴,۹۳۳.۴۷ ۲۴۵,۳۴۹.۴۹ ۲۲۸,۶۸۶.۹۷ ۲۷۷,۶۳۹,۶۵۵.۹۳
دانمارک ۲۵۱,۴۷۸.۴۷ ۳۵۶,۰۸۴.۸۷ ۳۴۳,۲۰۳.۳۱ ۱۶۵,۹۳۴,۵۴۹.۲۹
استونی ۲۱,۷۷۶.۰۰ ۳۰,۶۵۰.۲۹ ۳۹,۲۶۱.۰۰ ۷۴,۱۴۴,۳۸۱.۸۱
فنلاند ۲۰۳,۷۳۱.۲۴ ۲۶۹,۷۵۱.۳۱ ۲۸۰,۰۲۴.۱۸ ۱۰۵,۵۳۱,۷۹۱.۶۳
فرانسه ۲,۰۵۷,۱۲۶.۰۳ ۲,۶۳۰,۳۱۷.۷۳ ۲,۷۳۲,۴۳۶.۱۶ ۱۰,۴۲۸,۱۷۴,۳۳۷.۱۳
آلمان ۲,۸۱۲,۷۱۸.۴۵ ۳,۸۴۶,۴۱۳.۹۳ ۳,۷۳۲,۲۳۶.۰۵ ۱۳,۰۳۶,۵۸۷,۵۸۷.۰۹
یونان ۱۷۴,۸۹۳.۲۱ ۱۸۸,۸۳۵.۲۰ ۲۴۱,۸۶۵.۷۰ ۲,۸۱۲,۲۳۳,۴۵۰.۰۱
مجارستان ۱۱۰,۳۲۳.۳۵ ۱۵۵,۸۰۸.۴۴ ۱۵۶,۴۲۶.۸۶ ۳۸۲,۴۳۹.۲۴
ایرلند ۱۶۰,۵۶۱.۰۷ ۴۲۵,۸۸۸.۹۵ ۲۲۲,۹۰۱.۴۱ ۴۱,۲۰۳,۹۴۲,۲۷۸.۶۵
ایتالیا ۱,۴۸۶,۹۱۰.۴۴ ۱,۸۸۸,۷۰۹.۴۴ ۱,۹۷۷,۹۲۶.۸۹ ۷,۹۵۹,۷۵۴,۱۳۵.۳۶
لتونی ۲۵,۷۷۶.۷۴ ۳۳,۷۰۷.۳۲ ۴۴,۵۵۴.۷۸ ۱۱۷,۶۶۷,۴۳۹.۸۳
لیتوانی ۴۳,۶۷۹.۲۰ ۵۶,۵۴۶.۹۶ ۶۸,۲۴۳.۳۲ ۱۳۶,۸۰۴,۷۷۷.۳۶
لوکزامبورگ ۳۵,۹۵۳.۲۹ ۷۳,۳۵۳.۱۳ ۵۸,۰۲۰.۳۹ ۲۳۵,۰۹۲,۸۱۳.۸۵
مالت ۹,۸۰۸.۷۶ ۱۴,۶۴۷.۳۸ ۲۳,۴۲۵.۹۵ ۷۷,۰۶۳,۳۱۲.۸۸
هلند ۶۲۰,۰۵۰.۳۰ ۹۱۳,۸۶۵.۴۰ ۸۳۰,۸۹۷.۵۶ ۶,۸۸۳,۶۶۲,۹۷۸.۷۱
لهستان ۴۵۳,۱۸۶.۱۴ ۵۹۶,۶۲۴.۳۶ ۶۱۰,۱۰۲.۹۰ ۱۸۱,۶۷۱,۰۵۲.۶۱
پرتغال ۱۹۰,۵۰۹.۹۸ ۲۲۸,۵۳۹.۲۵ ۲۶۲,۵۲۹.۸۱ ۱,۱۵۵,۳۵۷,۸۶۵.۶۴
رومانی ۱۹۸,۸۶۷.۷۷ ۲۴۸,۷۱۵.۵۵ ۲۷۳,۵۸۸.۸۳ ۶۱۸,۶۸۰,۲۲۰.۳۳
جمهوری اسلواکی ۸۳,۸۴۵.۲۷ ۱۰۵,۱۷۲.۵۶ ۱۲۱,۳۹۱.۰۶ ۲۶۳,۰۳۹,۷۸۳.۲۵
اسلوونی ۳۷,۹۲۹.۲۴ ۵۳,۵۸۹.۶۱ ۶۰,۶۳۴.۹۷ ۴۹,۶۳۷,۱۰۲.۷۱
اسپانیا ۹۹۷,۴۵۲.۴۵ ۱,۲۸۱,۴۸۴.۶۴ ۱,۳۳۰,۲۷۶.۰۸ ۲,۳۸۰,۶۰۴,۷۹۶.۸۳
سوئد ۳۸۲,۲۴۰.۹۲ ۵۴۱,۲۲۰.۰۶ ۵۱۶,۲۲۸.۱۹ ۶۲۴,۵۹۳,۷۹۸.۸۲

نکته تحلیلی: اگرچه جمع کل این ارقام بزرگ به نظر می رسد، اما مجموع این ستون (RSS) کمترین مقدار ممکنی است که می توان با یک خط روند خطی به آن دست یافت. هر خط دیگری با ضرایب متفاوت، مقداری بزرگ تر برای RSS تولید خواهد کرد.

خط پایانی (The Bottom Line)

مجموع مربعات باقی مانده (RSS) معیار سنجش کمی انحرافات و خطاهای پیش بینی یک مدل رگرسیون نسبت به واقعیت بازار است. کمینه سازی این شاخص پایه و اساس برازش خطی در اقتصادسنجی و معاملات کمّی به شمار می رود.

RSS به تحلیل گران کمک می کند تا مدل هایی با کمترین میزان انحراف و بالاترین توانایی توضیح دهندگی برای تحلیل حرکات قیمت و متغیرهای کلان بسازند.

فایل آماده شد. تمام نیم فاصله ها با فاصله کامل جایگزین شدند و فرمول ها و جداول به صورت منظم ارائه شدند. اگر مقاله دیگری دارید بفرستید.

سؤالات متداول

  1. آیا RSS همان ضریب تعیین (R²) است؟

    ‌خیر؛ شاخص RSS نشان دهنده مقدار مطلق واریانس توجیه نشده توسط مدل است، در حالی که ضریب تعیین (R²) نسبت و درصدی از کل واریانس داده ها را نشان می دهد که توسط مدل رگرسیون تبیین شده است. رابطه این دو به صورت زیر تعریف می شود: R2=1−RSSTSS

  2. آیا RSS همان مجموع مربعات برآورد خطا (SSE) است؟

    ‌بله؛ در متون آماری و اقتصادسنجی، عبارت Residual Sum of Squares (RSS) و Sum of Squared Errors (SSE) معادل یکدیگر بوده و به یک مفهوم اشاره دارند.

  3. تفاوت بین RSS و مجموع کل مربعات (TSS) چیست؟

    ‌مجموع کل مربعات (Total Sum of Squares یا TSS) کل تغییرات و واریانس موجود در مقادیر واقعی داده ها را حول میانگین اندازه می گیرد، در حالی که RSS تنها پراکندگی خطاهای باقی مانده پس از اعمال مدل رگرسیون را می سنجد. در واقعیت: TSS=ESS+RSS

  4. آیا مقدار RSS می تواند برابر با صفر باشد؟

    ‌بله؛ اگر تمامی نقاط داده دقیقاً بر روی خط یا منحنی رگرسیون قرار بگیرند، خطای هر داده صفر شده و RSS = 0 خواهد شد. این حالت بیانگر برازش مطلق (Perfect Fit) است، هرچند در بازارهای مالی و داده های تجربی به دلیل وجود نویز، وقوع RSS = 0 عملاً غیرممکن بوده و در صورت رخ دادن در داده های آموزش مدل، نشانه قطعی بیش برازش (Overfitting) است.

رای شما به این مطلب

میانگین امتیازات 0 / 5. تعداد آرا: 0

از اینکه این مطلب مفید نبود عذرخواهی میکنیم

اجازه بدهید ما این مطلب را مفیدتر کنیم!

لطفا نظر خود را در بهبود این مطلب با ما در میان بگذارید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *