微软MAI模型被曝使用未授权网络数据训练

2026年6月5日,科技媒体The Decoder报道称,微软新发布的MAI系列AI模型部分训练数据来自Common Crawl等开放网络资源,与其此前宣称的‘仅使用企业级、干净且商业授权数据’存在出入。该结论基于微软官方技术论文披露的混合数据方案——包含授权人类生成数据与公开可得网络数据。微软称其爬虫遵守robots.txt等协议,但争议在于默认抓取未屏蔽内容,将内容保护责任转嫁给网站所有者。此事引发对其数据合规性与宣传一致性的质疑。

免责声明:本文内容由开放的智能模型自动生成,仅供参考。

上一篇:

下一篇: