🔬연구에임인텔리전스, 글로벌 피지컬 AI 안전 컨소시엄 ‘PASC’ 띄운다AI 보안 기업 에임인텔리전스가 로봇 및 자율 시스템의 안전을 연구하는 글로벌 컨소시엄 PASC를 출범함.에임인텔리전스피지컬AIAI안전디지털투데이1분 · 4일 전
🚀스타트업문샷 AI, 알리바바 통해 엔비디아 칩 2만개 사용설중국 AI 개발사 문샷 AI가 알리바바를 통해 엔비디아 칩 약 2만개를 확보하여 Kimi 시리즈 개발에 활용 중이라는 보도가 나왔다.문샷 AI엔비디아Kimi K3디지털투데이1분 · 약 2개월 전
🔬연구中 AI, 보안 분야서 앤트로픽 미토스급 파워…트럼프 AI 정책 역풍중국 AI 시스템이 사이버 보안 분야에서 앤트로픽 최고 모델에 필적하는 성능을 보이며 미국 AI 정책에 압박을 가하고 있다.중국 AI사이버 보안GLM-5.2디지털투데이1분 · 3개월 전
🚀스타트업한국딥러닝, 1.2B 모델로 글로벌 '문서 파싱' 부문 1위...구글·오픈AI 제쳤다한국 AI 기업 한국딥러닝이 글로벌 문서 파싱 벤치마크 '파스벤치'에서 1.2B 모델로 비전언어모델(VLM) 부문 종합 1위를 차지했다.한국딥러닝문서 파싱AI 벤치마크AI타임스1분 · 3개월 전
🔬연구독파모 4개사, '벤치맥싱' 의혹 일축...독자 AI 파운데이션 모델(독파모) 프로젝트 2차 평가를 앞두고 제기된 '벤치맥싱' 의혹에 대해 SKT, LG AI연구원, 업스테이지, 모티프테크놀로지스 4개사가 모두 사실이 아니라고 밝혔다.독파모벤치맥싱AI 평가AI타임스1분 · 약 1개월 전
🧠LLM큐원3.8-맥스, 벤치마크 비해 경쟁력 없어...AI 모델의 '숨은 비용' 함정알리바바의 신규 AI 모델 '큐원3.8-맥스'가 자체 홍보와 달리 독립 벤치마크에서 기대 이하의 성능을 보였다.큐원3.8-맥스AI 모델성공당 비용AI타임스1분 · 약 1개월 전
🔬연구문샷 AI, AI의 '보는 능력'만 측정하는 '퍼셉션벤치' 오픈소스로 공개… "추론보다 시각 인지가 더 큰 병목"중국 AI 스타트업 문샷 AI가 AI의 순수한 시각 인지 능력을 독립적으로 평가하는 벤치마크 '퍼셉션벤치'를 오픈소스로 공개했다.문샷 AI퍼셉션벤치멀티모달 AIAI타임스KR1분 · 약 2개월 전
🔬연구퍼플렉시티, 연구 에이전트 벤치마크 'WANDR' 출시…최고 AI도 실무는 한계AI 연구 에이전트의 실제 업무 수행 능력에 대한 새로운 벤치마크 'WANDR'가 공개되었습니다.퍼플렉시티AI 연구 에이전트벤치마크AI타임스1분 · 2개월 전
🔬연구장시간 컴퓨터 사용 능력 벤치마크 공개…'오퍼스 4.8' 최고점AI 연구소 X랭이 실제 전문가 수준의 장기 컴퓨터 업무 수행 능력을 평가하는 새로운 벤치마크 'OS월드 2.0'을 공개했다.AI 벤치마크AI 에이전트OSWorld 2.0AI타임스1분 · 3개월 전
🔬연구에포크 AI, '장기 개발 능력' 벤치마크 공개...“코드 암기론 통과 못해”에포크 AI가 AI 모델의 장기간 소프트웨어 개발 능력을 평가하는 새로운 벤치마크 '미러코드(MirrorCode)'를 공개했습니다.AI 벤치마크소프트웨어 개발에포크 AIAI타임스1분 · 3개월 전
🔬연구"앤트로픽·커서 모델, 정답 도출 대신 '검색'했다"…'보상 해킹' 실태 공개AI 모델의 성능 향상과 함께 벤치마크 시스템의 허점을 파고드는 '보상 해킹' 현상이 심화되고 있다는 조사 결과가 발표되었습니다.보상 해킹AI 모델 평가코딩 에이전트AI타임스1분 · 3개월 전
🔬연구오픈AI, 생명과학 AI 벤치마크 '라이프사이벤치' 공개...오픈AI가 생명과학 분야 AI 모델의 실제 연구 역량을 측정하기 위한 새로운 벤치마크 '라이프사이벤치'를 공개했습니다.오픈AI생명과학 AI벤치마크AI타임스1분 · 3개월 전